全球AI大模型賽道正經歷一場深刻變革。過去半年間,行業競爭焦點從語言理解與文本生成加速轉向真實世界的感知、推理與交互能力。主流玩家紛紛布局多模態大模型,將文本、圖像、***、音頻甚至動作數據整合至統一框架,推動AI從“問答工具”向“理解物理規律與因果邏輯”的智能體進化。這一趨勢在2026年世界人工智能大會(WAIC)上得到集中展現:從具身智能到***生成,從AI Agent到跨模態交互,“世界模型”成為貫穿多個前沿領域的關鍵詞。
資本市場的反應印證了這一技術浪潮的爆發力。據不完全統計,近三個月內,全球“世界模型”及相關方向融資規模突破百億元人民幣,頭部項目估值持續攀升。在這場資本盛宴中,一家來自合肥的多模態生成式AI公司——智象未來(HiDream.ai)成為焦點。該公司近日宣布完成15億元C輪融資,投后估值超10億美元,正式躋身獨角獸行列。更引人注目的是,這已是其三個月內完成的第三輪融資,累計融資額超21億元。
智象未來的融資歷程堪稱“豪華天團”集體加持。本輪由社保基金四川振興科創基金、工銀資本、弘頤資管、敦鴻資本聯合領投,廈門國貿資本、上影新視野基金、湖北長江產業投資集團等20余家機構跟投,老股東合肥產投、東方富海等持續加注。從資方結構看,國家隊、產業資本與頂級財務機構形成三大支柱:社保基金首次布局原生全模態世界模型領域;合肥國資通過八家本地機構實現A至C輪全程陪伴;華策影視、上影新視野基金等影視巨頭則帶來產業***深度綁定。
產業資本的集中入局尤為值得關注。以上影新視野基金為例,其總經理顧宇灝透露,團隊自2024年起便與智象未來圍繞動畫大模型、影視工業化路徑展開多輪探討,最終促成廈門國貿資本等國資LP共同投資。這種合作不僅基于技術判斷,更源于對產業落地能力的考量。在影視制作領域,AI模型需解決跨鏡頭一致性、導演級可控性、版權合規等復雜問題,而智象未來是少數兼具技術、內容與商業變現能力的廠商。據悉,雙方將聯合制定AI大屏制片標準,推動AIGC深度融入影視工業流程。
技術路線的前瞻性是智象未來贏得資本青睞的核心。不同于后期拼接的多模態方案,該公司選擇原生全模態(UiT)架構,將文本、圖像、***、空間、動作等信號統一建模,實現“任意模態輸入輸出”。這種設計使模型具備世界模擬所需的基礎能力:在統一框架中理解并預測現實世界狀態。2026年4月,其發布的HiDream-O1架構及后續圖像系列模型,在Artificial Analysis評測中登頂全球文生圖榜單,閉源版本亦躋身前三,驗證了技術路線的有效性。
創始團隊背景為技術突破提供底層支撐。公司CEO梅濤作為加拿大工程院外籍院士,帶領團隊早在2017年便發布全球首個文生***模型TGANs-C,核心成員至今仍主導研發工作。這種十年以上的技術積累,使其在視覺生成領域形成獨特優勢。而全球頭部大廠的動向亦印證了這一路線的前瞻性——2026年初,谷歌、英偉達幾乎同時將原生全模態作為下一代模型架構方向。
商業化落地能力構成另一重護城河。智象未來構建了“大模型+Token Hub平臺+場景應用”的三層架構,圍繞商業營銷、影視創作、內容生成三大領域推出AIGC產品。在WAIC 2026上,其發布的多模態創作智能體vivago R1引發關注,該產品具備無限時長***生成與編輯能力,標志著AI從單點素材輔助向長鏈路創作任務的跨越。目前,公司服務已覆蓋全球100多個國家和地區,擁有超4萬家企業客戶及5000萬OPC用戶,形成顯著的規模化優勢。
多模態競爭的本質正在從技術參數轉向產業深度。當通用語言模型陷入同質化與價格戰時,視覺應用因垂直場景的復雜性,更依賴數據質量、工程能力與行業理解。這為具備底層架構創新與場景落地能力的企業創造了差異化空間。智象未來的案例表明,世界模型的突破不僅需要技術前瞻性,更需將能力轉化為可復用的業務結果——這或許是多模態時代真正的競爭法則。返回搜狐,查看更多
