今年WAIC,具身智能厂商集中包下展馆单独一层。在京剧、踢球、舞蹈等表演展台前依然围满举着手机的观众。但在楼下或楼外的论坛里,产业一线的声音远没有那么热闹。


展台热闹之外,焦虑也在产线蔓延。“能用到可用,是从0.1到100的鸿沟。”智元合伙人、高级副总裁,觅蜂科技董事长兼CEO 姚卯青说。博世中国战略副总裁、机器人业务负责人刘敏甚至给出更具体的数字:节拍压进6秒、准确率做到99%以上。达不到这些数字,工厂不会买单。


具身智能正在从Demo艰难走向能稳定干活、不出错的交付阶段。模型和硬件都有各自的硬仗要打。


具身智能仍未解决准确性、泛化性等问题


在“AI in Action·腾讯AI应用创新论坛”的圆桌讨论上,产业一线几乎将矛头都指向了实验室与现实间的落差。


姚卯青坦承,具身和人形机器人在制造场景中的应用依然处于协作和实验阶段。“目前更多还是协作机器人在解决工业自动化尚未解决的问题,以提高效率、代替人工实现柔性。”


“行业去年已经解决了运动性问题,今年在探索、迭代操作性问题。”刘敏认为,算法变成具身大脑落地,在一些工业场景已可满足使用。在商用场景,机器人能从60秒左右压缩到30秒左右,但准确率需要提高至90%以上。


机器人在实验室能干活,不代表去到现实世界也能干活,这背后涉及节拍、准确性、泛化性等问题。


节拍与机器人的速度有关,以工业场景为例,6秒可能只是门槛,并且需要机器人在执行任务时实现99%以上的准确度。


姚卯青分享了一个真实案例。上个月在江西南昌的产线上,智元机器人六天操作六万多件产品,成功率达到99.99%,但此前已经在24小时产线上全工段跑了三四个月。


腾讯首席科学家、Robotics X 实验室主任、福田实验室主任张正友在接受新京报贝壳财经等媒体采访时表示,Physical AI可以在不完美的情况下落地。工业领域存在某些物体类别较少、环境相对结构化、需要数据量相对较少的场景,通过互联网视频、第一人称、UMI采集等数据增加预训练,就能快速适配。“唯一差别可能是针对某些场景多采集一些数据。”


而进入家庭等非结构性环境的要求则截然不同。“需要从机器人形态、智能等方面保障100%安全。”张正友说。


泛化性则关系到机器人能否完成更多具体任务。“这个鸿沟可能是因为在实验室时,机器人所有的数据场景都是提前设计好的,一旦走向真实世界、开放任务,模型暂时无法展现智能涌现的能力。”北京大学计算机学院研究员、博士生导师仉尚航认为,具身智能还没有解决泛化性问题。模型是具身研究的基础,目前还处于百花齐放的开始阶段。


模型技术尚未收敛,分层架构将长期稳定


具身智能研究需要模型、本体和数据形成闭环。目前整个具身智能的技术栈远未收敛。去年VLA(视觉-语言-行动)还是行业热词,今年主角已经换成了世界模型。但究竟什么是世界模型,行业连定义都还没对齐。


在张正友看来,VLA的短板是明确的,它没有预测能力,而世界模型可以基于行动后果进行预测。VLA要实现泛化需要大量数据,VLM 出现后,基于海量视频、图像训练,提高了理解能力,VLA开始向世界模型的范式推进,世界模型也开始接上行动这一层。


今年WAIC期间,腾讯Robotics X实验室及福田实验室联合腾讯混元推出两款具身智能基座模型:具身VLM基座模型Hy-Embodied-VLM-1.0,以及具身世界认知基座模型Hy-Embodied-RxBrain-1.0(简称RxBrain)。


RxBrain将机器人左右脑之间的“高速桥梁”连接起来,同时传递语言和视觉信息。模型在分解子任务时,可以用文字、图像“描述”世界,让机器人在执行任务时,可以同时使用语言和视觉描述来指导执行。


“相比其他仅用文本或简单拼凑的方案,我们模型的效果有明显提升。”张正友说。同时,RxBrain也能根据子任务完成情况对世界进行预测。


在张正友看来,世界模型下一个有价值的方向,在于模型同时传递语言和图像信息,能推理,也具备想象力。


对于模型架构,张正友认为分层架构将长期稳定,“因为这接近人脑的结构”。但每一层内部的模型实现会持续迭代。


人机交互的难题同样需要分层来解决。张正友指出,机器人操作物体、与人物理接触的问题最难解决,通常涉及触觉和力的感知。


“人机交互容错率极低,搀扶老人时不能捏碎骨头或让其受伤,一旦机器人与人接触时绊了一脚,需要底层快速的肢体反应,而用VLA模型100毫秒的决策周期根本来不及。触觉反馈约需1毫秒,视觉反馈最快15毫秒。目前要实现这样的效果还有许多工作要做,需要将不同频率的感知信息与模型结合。”张正友说。


模型要翻越的另一道坎是数据。目前行业对数据金字塔已形成一定共识:最底层为互联网视频数据,第二层是第一人称操作的数据,第三层是UMI采集的数据,最顶层是真机遥操数据。


张正友认为,如果模型泛化能力越来越强,遥操数据需求可能会越来越少,第二层和第三层的数据需求可能会越来越多、要求越来越高,“但数据质量永远是第一位。”


硬件未迎来终局


“模型属于技术问题,硬件属于工程问题。大脑问题解决后,下一个瓶颈将是硬件。”越疆科技股份有限公司创始人、董事长兼CEO刘培超提出,现阶段行业依然需要加大工程能力突破硬件瓶颈。


他以机器人手臂为例解释称,过去机械臂有6个轴,现在至少20个轴、20个关节起步,系统更复杂,稳定性将成为瓶颈。


刘培超对现阶段硬件条件下人形机器人能否在工业场景中撑起5万小时性能存疑。“5万小时是行业通用要求,实现5万小时后再突破10万小时,这是一个循序渐进的过程。目前在工业场景,手臂已经能支撑10万小时的性能。”


姚卯青也指出,具身智能许多零部件的可靠性还未经过充分的时间检验。这个赛道真正成长只有两三年,现阶段许多零部件甚至还没有达到类似汽车16949标准的要求。


“需求驱动硬件。一定要认清将来可能主要应用的场景,再设计硬件。”他以灵巧手为例:将自由度集中在那么小的空间里很难,需要在应用中寻找可靠性、成本、负载等“不可能三角”的平衡。“许多灵巧手依然存在一些早期问题,比如采集数据一两周就需要返修,或每工作半小时就要散热。这些可以通过探索应用改善。”


行业内也存在“由模型定义本体”的声音。仉尚航认为,具身开放平台需要系统迭代形成飞轮,而这应当由模型来定义问题,比如自由度怎么设计、关节怎么设计,让机器人更具泛化性,甚至更容易跨本体升级和迭代。


这与腾讯具身智能战略选择形成呼应。腾讯不做硬件本体,而是以Tairos(钛螺丝)平台承担具身大脑的角色,面向机器人本体厂家和应用开发商输出能力,同时通过硬件抽象层快速适配不同厂商的设备。


张正友用手机、电脑行业打了个比方:就像iOS与安卓、Mac与Windows,机器人行业也会分化出“全栈自研”和“平台+生态”两条路,腾讯选的是后者。目前,Tairos已与越疆、宇树、智元等头部厂商落地合作。


新京报贝壳财经记者 韦英姿

编辑 岳彩周

校对 贾宁