全球AI大模型赛道正在经历一场深刻的重塑。过去这半年里,行业的竞争重心从单纯的语言理解和文本生成,加速转向了对真实世界的感知、推理以及交互能力。主流玩家纷纷布局多模态大模型,试图将文本、图像、视频、音频甚至动作数据整合进一个统一的框架中,推动AI从简单的“问答工具”进化为能理解物理规律与因果逻辑的智能体。这一趋势在2026年世界人工智能大会(WAIC)上得到了集中体现:无论是具身智能、视频生成,还是AI Agent与跨模态交互,“世界模型”都成了贯穿多个前沿领域的核心关键词。
资本市场的反应直接印证了这股技术浪潮的爆发力。据不完全统计,近三个月内,全球“世界模型”及相关方向的融资规模突破了百亿元人民币,头部项目的估值也在持续攀升。在这场资本盛宴中,来自合肥的多模态生成式AI公司——智象未来(HiDream.ai)成为了焦点。该公司近日宣布完成15亿元C轮融资,投后估值超过10亿美元,正式跻身独角兽行列。更引人注目的是,这已经是其三个月内完成的第三轮融资,累计融资金额超过了21亿元。
智象未来的融资历程堪称由“豪华天团”集体加持。本轮由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团等20余家机构跟投,老股东合肥产投、东方富海等也持续加注。从资方结构来看,国家队、产业资本与顶级财务机构形成了三大支柱:社保基金首次布局原生全模态世界模型领域;合肥国资通过八家本地机构实现了从A轮到C轮的全程陪伴;华策影视、上影新视野基金等影视巨头则带来了深度的产业资源绑定。
产业资本的集中入局尤为值得关注。以上影新视野基金为例,其总经理顾宇灏透露,团队自2024年起便与智象未来围绕动画大模型、影视工业化路径展开了多轮探讨,最终促成厦门国贸资本等国资LP共同投资。这种合作不仅基于技术判断,更源于对产业落地能力的考量。在影视制作领域,AI模型需要解决跨镜头一致性、导演级可控性、版权合规等复杂问题,而智象未来是少数兼具技术、内容与商业变现能力的厂商。据悉,双方将联合制定AI大屏制片标准,推动AIGC深度融入影视工业流程。
技术路线的前瞻性是智象未来赢得资本青睐的核心。不同于后期拼接的多模态方案,该公司选择了原生全模态(UiT)架构,将文本、图像、视频、空间、动作等信号统一建模,实现“任意模态输入输出”。这种设计使模型具备了世界模拟所需的基础能力:在统一框架中理解并预测现实世界状态。2026年4月,其发布的HiDream-O1架构及后续图像系列模型,在Artificial Analysis评测中登顶全球文生图榜单,闭源版本亦跻身前三,验证了技术路线的有效性。
创始团队的背景为技术突破提供了底层支撑。公司CEO梅涛作为加拿大工程院外籍院士,带领团队早在2017年便发布了全球首个文生视频模型TGANs-C,核心成员至今仍主导研发工作。这种十年以上的技术积累,使其在视觉生成领域形成了独特优势。而全球头部大厂的动向也印证了这一路线的前瞻性——2026年初,谷歌、英伟达几乎同时将原生全模态作为下一代模型架构方向。
商业化落地能力构成了另一重护城河。智象未来构建了“大模型+Token Hub平台+场景应用”的三层架构,围绕商业营销、影视创作、内容生成三大领域推出了AIGC产品。在WAIC 2026上,其发布的多模态创作智能体vivago R1引发了关注,该产品具备无限时长视频生成与编辑能力,标志着AI从单点素材辅助向长链路创作任务的跨越。目前,公司服务已覆盖全球100多个国家和地区,拥有超4万家企业客户及5000万OPC用户,形成了显著的规模化优势。
多模态竞争的本质正在从技术参数转向产业深度。当通用语言模型陷入同质化与价格战时,视觉应用因垂直场景的复杂性,更依赖数据质量、工程能力与行业理解。这为具备底层架构创新与场景落地能力的企业创造了差异化空间。智象未来的案例表明,世界模型的突破不仅需要技术前瞻性,更需将能力转化为可复用的业务结果——这或许是多模态时代真正的竞争法则。













