具身智能的新气象
WAIC场馆外的电闪雷鸣,恰似地球生命初诞生之态,点燃了具身智能这一新生物种的探索热情。
还没踏入世博展览馆,周边路口就已能看见人形交通机器人在车流中引导方向,仿佛预示着本届WAIC,具身智能将唱主角。
参展数量惊人地证明了这一点。今年具身智能赛道的参展商数量较去年激增,从80多家跃升至200余家,占据了全部展商的五分之一左右。展出的真机超过300台,各式机器人吸引了无数观众驻足。
穿梭于场馆之间,最直观的感受便是人头攒动,热闹非凡。
宇树在展台中央搭起打擂台,两台人形机器人上演了激烈的MMA对决,拳拳到肉,零件散落一地,现场观众呼喊声此起彼伏。加速进化也搭建了迷你足球场,借世界杯热潮上演机器人足球赛。松延动力的展示则更为直接,邀请观众尝试"踢"机器人,结果机器人只是微微后退几步,平衡性令人惊讶。
赛博风格的场景也比比皆是。一群coser牵着机器狗在展馆内漫步,突然遭遇一只双腿短小、顶着卡通大头的"豆脚"机器人,它不仅走着走着劈叉,甚至动作颇具魔幻色彩。
光锥智能敏锐地察觉到,今年具身智能的发展趋势已经发生明显变化。
虽然目前仍有一些"表演"性质的性质,但更多企业已将重点转向具体的"上班场景"。
汽车线束产线、仓库、药房、零售货架、洗衣房、家庭客厅……这些真实场景被1:1复刻到展馆中,各类不同构型机器人在内流畅执行长程任务。机器人不仅开始要求"干活",干活场景也呈现出分化趋势。
与此同时,具身智能大脑技术路线也清晰呈现新变化。
此前反复强调的VLA与世界模型之争,在今年展会上似乎销声匿迹。取而代之的是,通过Agent调度原子化技能、实现"一脑控多机"、精准完成标准化任务的模式。
具身智能行业仍未解决数据难题。
真机数据依旧是行业普遍面临的困境。许多展示都是依托于提前到场连夜采集数据、现调试的模型。这意味着现阶段的数据量尚无法让模型快速适应不同场景。因此,提升模型泛化能力,仍是最直接的商业模式门槛。
2026WAIC的具身智能需要时间成长,但留给行业玩家的时间已不多。
当前具身智能行业的出货主要集中在教育科研和数据采集等领域,这些远未达到成功的商业化标准。在过渡性需求结束之前,市场期待看到谁能真实为场景创造价值。
2026年,机器人将迎来直接"打工"的最佳时机
工作,是今年具身智能演示的核心要义。按照场景在展馆游览一圈,会发现各厂商机器人的"职业分工"已相当细致。
工业是今年密度极高的场景,分工也更加细化。
针对分拣环节,极智嘉直接将一个小型产线搬进了展台,人形机器人Gino 1负责从物料箱中抓取商品。无论是形状各异的薯片、面包,还是外形不规则的毛绒玩具,Gino 1都能准确无误地抓取。
Gino 1不仅能独立抓取货物、搬运物料箱,与移动机器人、专用工作站组合后,还能形成自动化编组,自主完成从拣选、搬运到投递的全流程作业,且具备一定的抗干扰能力。从交付逻辑看,极智嘉似乎不只是证明单机器人的强大,而是着力提供提升整条产线OEE的系统方案。
将产线复刻到展馆的还有艾普特。其A1机器人负责汽车线束插接的精细工作。柔软线束稍一触碰就会变形,且容易缠绕,A1必须实时调整抓取策略,完成亚毫米级的孔位插接,一旦失误整个流程都需中断。
这类高精操作在场馆内还有很多类似演示,颇具看点。
在传统VLA机器人感知框架里,视频输入存在帧数限制。机器人"看到的可能并非最实时画面",导致输出可能存在几毫米误差,这是常态。这也限制了机器人处理精细活的能力。现在,厂商已解决了这个问题。
除了分拣和高精度操作,重载方向也有厂商押注。智元与京东物流联合推出的安规级重载具身机器人精灵G2 Max,现场单手就能举起15公斤哑铃,未来计划部署于京东物流"智狼仓"承担重物搬运。银河通用的重载人形机器人Galbot S1,能完成拆垛、搬运和码垛,单箱最高50公斤,每小时处理80至90箱,续航约10小时。
虽然这些机器人执行的并不复杂,单小时效率尚不如人工。但重物搬运场景使用机器人的优势已开始显现,机器人不再只是"摆设",还能持续长时间作业。
工业场景被认为是具身智能最先实现"工作"的地方。但本次WAIC上,面向消费者的零售和服务场景同样释放出"就绪"的信号。
蚂蚁灵波的展位呈现真实药房场景,有人在线上下单,不到一分钟,机器人就完成接单、取货、放药上柜台等一系列动作。现实中,下一步将是等待骑手取走药品。这套方案已在国大药房上海门店落地,并对接了外卖平台。
更有意思的是,展位内三台不同构型的机器人,分别来自乐聚、星尘智能与蚂蚁灵波,造型各异,却都共用LingBot-VLA 2.0这一大脑。类似"一脑控多形"、"一脑控多手"的架构,普渡和机器科学等也在展示,似乎已成为今年主流选择。
在一个模拟超市的展台,银河通用的Galbot G1机器人正在帮人烤面包片、倒咖啡。现场无论工作人员如何干扰,比如临时挪动杯子位置、用手遮挡杯口,机器人都能重新寻找目标或暂停动作。据光锥智能了解,其自研大模型"银河星脑"已装机于三类机器人,能完成3至5分钟的长程任务。
能自主执行长程任务,已成为了这次WAIC上展示干活能力的标配。
智平方的AlphaBot 2,能现场调制鸡尾酒,制作各种饮料;优理奇的保姆机器人能做手磨咖啡、烤披萨,这些都不是单一短动作,而是由多个步骤组成的复杂任务。长任务的核心价值在于,机器人对任务的理解能力和执行能力得到了质的飞跃。相比短任务的"程序化"、"模式化",执行长任务才算真正"办事"。这意味着,未来人可以把更多完整任务交给机器人处理。
种种迹象表明,今年具身智能的变化已相当明显。
2025年,机器人在工业场景执行的任务只是"拧螺丝"和分拣,在ToC场景无非是"做咖啡"和"取物品"。今年机器人能处理的东西更多,能应对的场景更复杂,一个大脑开始控制不同形态的多台机器人,长程任务也不再是少数展台的特例。打工场景正从"能做一些动作"转向"能承担一类工种",工业、零售、服务之间的分工也日益清晰。
这一切都指向一个目标,让机器人深入具体场景,变得更加实用。可以看出,具身智能行业已到了商业兑现的门槛。但从"动起来"到"用起来",仍存在巨大差距。
泛化能力是模型最重要目标
参观时很容易感受到,今年机器人在行走、奔跑、抓取、搬运等动作上已相当流畅。但真正决定它们能否派上用场的,是如何理解物理世界、如何自主决策。这些能力,依然受困于数据与算法瓶颈。
今年,光锥智能发现,过去具身智能大脑模型的端到端叙事逐渐式微。
前两年具身行业谈论必提端到端,描绘得非常美好。类比自动驾驶,机器人也能用单个模型从识别图像到输出动作,中间无需转换。但在今年WAIC现场,长程任务几乎全部采用Agent-based的分层架构——上层用单个Agent负责调度和任务理解,下层则是被分解的原子化技能模块。
所谓原子化技能,就是将抓、放、插、堆、折等任务抽象为标准化技能模块。大模型先理解指令和上下文,再由Agent根据当前任务组合不同的技能模块。
这一模式兴起的背景在于,业内发现端到端虽然出现Scaling Law的信号,但并不代表马上能用。一旦换到新环境,需要大量专家重新训练,验证,耗费数月调试。而原子化技能是基于已有技能做适配,无需从头训练,部署周期可大幅缩短。更重要的是,当同一模型应用到其他本体上,这些技能可以复用。
展览上,光锥智能见到艾普特、普渡、原力灵机等厂商都在采用类似思路。例如原力灵机的机器人搭了"积木长城",过程就是机器人持续执行由特定工序组成、可循环的工作——从识别积木颜色与形状,到规划抓取姿态与放置位置,再到逐层堆叠成型。
但是光锥智能感觉,新方案在某种程度上是某种"放下执念"。
当前具身领域普遍认可的思路,仍是"大脑小脑"架构,大脑负责"智力上限",小脑负责具体调度执行。Agent-based有点像回归到规则时代的智驾,机器人看到一个物体,就输出需要操作的能力。从表现上看,它确实提升了场景和能力的泛化性,能不需要场景重训,能"无视"机器人本体差异。
但这条路逻辑清晰,更像是在当前数据与模型能力约束下的选择,不太可能通往"通用具身智能"终点。
关于具身模型训练环节,真机数据依然是行业共同难题。
截至2026年初,全球高质量真实物理交互数据总量约50万小时,仅及大语言模型训练数据的两万分之一。"在数据上需要大量积累,这是大家今年很强的共识。"智元合伙人、高级副总裁、具身业务总裁姚卯青指出,要达到高阶智能,真实物理世界的数据量级需达到亿小时级别。
为解决数据难题,行业主要有两大路径。
第一个是降低真实数据采集成本。智元拓展了无本体数据采集体系,即人通过手持、穿戴设备在真实场景中操作,同时记录动作轨迹、视觉和交互,再迁移到机器人模型训练。为此,智元推出轻量化作业和数据采集平台G2Air,这是一款7自由度机械臂,与自家采集设备原生同构,旨在最大限度复用无本体采集的数据,让这些数据能更好地衔接模型训练。
多数灵巧手展台上都能见到同构采集手套。戴上后,灵巧手会同步执行相同动作。除了销售采集设备、提供方案,某种程度上,这也是在降低开发者采集难度,以便建立数据回流通道。
第二条路是仿真先行,再用真机数据微调。比如苏度科技就偏爱这种做法,用物理仿真引擎在虚拟世界批量生成数据,先将机器人基础操作能力提起来。但仿真与真实世界之间存在迁移差距,所以模型训好之后,还需用真机在不同场景和任务中运行,用真实数据持续修正、打磨。
数据路径差异化后,光锥智能注意到,今年行业在单纯VLA还是世界模型上的争论已减少,现在基本都是混合路线。
各家都在探索其他可能。例如蚂蚁灵波的LingBot 2.0模型系列,就包含具身原生世界动作模型 LingBot-VA 2.0和具身基座模型 LingBot-VLA 2.0;千寻智能采用的是VLA+世界模型融合架构;智平方走"皮层-小脑-脊髓"的类脑路线;机器科学则推出了新架构VLOA,中间的"O"代表物体连续运动的3D点云轨迹,可描述物体在任务中的位置、姿态、形变和接触关系变化。
而极智嘉的双脑协同架构中,负责行动的小脑Gravity 4D具身模型扩展出二维视频预测能力,据称可预判风险后生成稳妥的连续动作序列。这显然也融合了世界模型特征。
当谁都无法确信机器人的最终形态时,将智能与硬件解耦、让同一套能力跨本体复用,正是行业不被数据困住、迈入下一阶段的通行证。
量产竞争之际胜负已分,生死将现
真实世界的入场券并不好拿。
去年,具身行业玩家们就高喊量产和商业化。但实际表现,确实不尽如人意。
据新战略咨询数据,2025年国内具身智能机器人出货中,科研教育仍是最大需求场景,占比42%,数据采集占19%,而真正用于产生商业价值的工业及物流,仅占4%。
这意味着,撑不到真实应用市场爆发的玩家,将在这一阶段被淘汰出局。
要跻身真实应用市场,仅证明能干活还不够,关键在于规模化量产能力。2026年作为具身智能的"量产元年",产能已成为明显分界线。
IDC数据显示,2025年全球人形机器人出货量接近1.8万台,智元、宇树以5000台量级位居第一梯队,其中智元在2026年3月底迎来第10000台机器人下线;乐聚、加速进化、松延动力处于千台级的第二梯队;其余厂商大多百台量级,或只有样机。
但今年,不能再这样了。
去年厂商只要能拿出Demo、让机器人动一动就算达标。今年,越来越多厂商将实现大规模量产作为重要目标之一。宇树年产能规划已达19万台;优必选将2026年出货目标上调至5000台;刚拿下某前置仓大客户,号称握有3亿订单在手的零次方,一边联系外部代工厂、一边寻找可靠供应商,借WAIC为扩产搭桥。
需要承认的是,当前阶段,科研教育、数据采集这样的过渡需求依然存在,但这终究不是终极场景。量产不只是把货卖出去,还要看卖到哪,是否有价值出货空间,是否可实现成功商业化。
今年WAIC被反复提及的名字,是京东智狼仓、长飞产线、国大药房、电池厂与汽车工厂。银河通用的Galbot S1进入了电池厂和汽车工厂,灵初的设备进入了长飞,蚂蚁灵波的智慧药房已在上海真实门店投入运营。从卖给实验室和展厅到抵达真正该用的地方,各家都在尝试完成这关键一步。
场景在这个过程中也越来越分化,以物流、巡检、搬运为主的"工厂派",与以零售、服务、家庭为主的"日常派",各自划出了清晰的落地方向。
通过这次WAIC展示可见,"量产"含义不只有整机出货,还包括数据的量产和模型的装机量。也有玩家从中发现机遇,当起了"卖铲人",试图用一套标准化算力平台帮行业跨过量产门槛。
例如地平线孵化的地瓜机器人,就推出了一套基于具身智能大脑平台的量产方案,算法适配近10款主流VLA模型,结合开发工具和生态伙伴,将机器人从样机到万台交付,拆解为"开发套件快速搭原型、模组真实场景调试、产业链协同规模化量产"三步路径。自己只做全行业的"卖铲人",让整机厂专注场景落地。
机器人必须走进真实世界积累经验,行业必须走进真实市场赚取收益。WAIC已办了八年,前些年还在谈路线、比参数、猜时间表,今年方向感前所未有清晰。
从百模大战式的混乱,到场景、数据、量产三条主线的收敛,具身智能在2026年上海完成了自己的成人礼。但现阶段的机器人进厂,主要目的还是建立试点,而非真正用于工作的规模化采购。要让工厂持续复购,后面还需算一笔关于稳定性与ROI的精细账。
接下来的竞争,既是分高下,也是决生死。














