8月26日晚,在第二届世界人形机器人大型组百米决赛上,北京人形机器人创新中心(以下简称“北京人形”)旗下天工Ultra机器人继开幕式预赛跑出9.39秒、复赛跑出8.85秒后,再次以8.64秒刷新竞赛纪录。


接连创下竞速纪录,斩获多项赛事奖牌,“捂脸跑”姿势出圈等,“天工系”机器人无疑是本届运动会上备受关注的明星赛队。闭幕式当天,北京人形CTO唐剑接受新京报贝壳财经记者专访。在他看来,“天工系”机器人在赛场上的亮眼表现,源自软硬件全面迭代升级。经过两届赛事的历练,人形机器人运动性能、复杂任务处理效率均得到显著提升,今明两年,机器人有望在工业、泛工业这类结构化、半结构化场景实现规模化应用。


北京人形CTO唐剑。受访者供图


天工Omni“捂脸跑”是算法迭代中的“无心插柳”


贝壳财经:本届运动会上,“天工系”机器人突破多项纪录,运动技能实现跨越式提升背后的关键原因是什么?


唐剑:首先在硬件本体上,以天工Ultra和天工Omni为例,二者都做了特别的设计,包括全系关节均为自研,在扭矩、转速上做了大量优化;采用铝镁合金等材料,并优化构型,把较重的关节上提、让下肢更轻盈;电池能在瞬时释放巨大电流,提供爆发力等,这些都能帮助机器人跑得更快。


其次,在算法上,机器人跑步、越障相比去年提升很大,例如,过弯道时,机器人能把上体压得很低(类似摩托车压弯),甚至在弯道上保持超过每秒10米的速度,都要归功于算法演进。以及现在网上特别火的天工Omni“娇羞”跑姿,也是通过算法长期摸索出来的、最快的跑步姿势。总体来看,是软硬件全面优化迭代的结果。


贝壳财经:怎么看天工Omni“捂脸跑”姿势出圈?训练时,是否对此有预料?


唐剑:我们并没有特意追求某种出圈的姿势,核心还是希望机器人能跑得更快、拿到金牌。现在运控路线普遍是“模仿强化学习”:先采集人类奔跑、跳跃、跳舞、打拳等动作,输入增强学习框架,进行不断学习。但在这一过程中,机器人既可能保留人类动作的相似性,也可能做出超过人类的独特姿势。“娇羞”跑姿就是算法在迭代过程中发现,机器人“少用手臂、更多转腰”能跑得更快而逐渐形成的。训练时,没有预料到“娇羞”跑姿会出圈,也没刻意做设计,算是“无心插柳柳成荫”。


天工Omni是公司发布的通用型小尺寸人形机器人,未来不同的算法也可以赋予它不同的能力。后续,我们会把“天工系”机器人的各项能力都开源给开发者和二次开发的合作伙伴,他们可以在这一基础上再开发出各种各样的动作。


贝壳财经:“天工系”机器人背后的慧思开物平台强调一脑多机一脑多能”,针对不同的本体如何进行技术兼容 


唐剑:这是一个好问题。控制机器人常用“大小脑分层架构”,上层VLA算法可适配多种本体,比如,今年年初开源的XR-1模型可适配七种不同本体,包括机械臂、人形机器人、轮式机器人等;底层运动控制算法则与本体强相关,目前各家都在做通用的WBC(Whole Body Controller,全身控制器),很多操作可以基于它来做,但刚度、阻尼等关键参数仍需针对每种本体进行精调,所以每个本体都有自己的一套控制器。


慧思开物平台的定位是“一站式通用具身智能开发平台”,它运行时是一个Agent系统(智能体系统)。平台的“一站式”是指提供各类工具和基础模型,包括预训练好的XR-1模型、世界模型、VLM大脑模型,以及站走跑、舞蹈、抓取放、开关门等技能模型;还会提供低代码图形化工具,拖拽即可开发。我们后续还会对此进行持续迭代,并尽量开放、开源。


贝壳财经:你提到全自主导航是机器人产业化落地的必要条件。怎么看今年大多数竞赛要求机器人全自主完成?


唐剑:举办世界人形机器人比赛的核心还是为了推动行业发展,让具身智能机器人能够深入千行百业、走进千家万户。公司方面,一贯坚持全自主路线,从首届马拉松半自主,到首届运动会田径赛全自主,再到第二届运动会大多数项目全自主,并且自主导航能力也有升级(例如,能快速过弯道),这是一个很大的进步。


从今年比赛能看到,机器人的运动性能大幅提升,完成更复杂的操作任务效率也大幅提升。预计今明两年,在半结构化和结构化场景,例如,在工业和泛工业场景里,可推机器人规模化应用。


3年内机器人在算法泛化能力上一定会有重大突破和进展


贝壳财经:历经两届运动会,人形机器人的能力发生了哪些重要变化?


唐剑:可以看到,机器人的比赛成绩较去年有飞跃式的提升;同时,在场景赛任务设置难度呈几何级增加且是闯关式的情况下,机器人操作效率大幅提升、逐步接近人类效率。负载、稳定性、可靠性、效率是机器人的“线性卡点”,正在稳步突破。但泛化能力是机器人的“非线性卡点”,目前还不知道何时能突破,对此,大家都在全力以赴。但一旦突破泛化能力,机器人就会以非常快的速度走进千行百业和千家万户。


贝壳财经:怎么突破泛化能力?把机器人在赛场上发挥的能力迁移到真实场景?


唐剑:一是从算法上突破。具身智能主要有VLM、VLA、WAM三种模型。VLA模型做简单操作可以,但在复杂任务上缺少“想象力”;WAM则擅长想象和预测,但不善于长程任务的规划、思考和推理;VLM模型则更擅长规划推理。我们把三个模型进行了统一融合,并做文本、视觉等多维度数据对齐,进一步提升生成动作的泛化能力和成功率。


二是从数据上突破。数据量需积累到百万甚至上千万小时的量级,才可能实现“量变到质变”。而相较于数据的数量,数据的质量和多样性更为重要。其中,数据的多样性严重缺乏,数采厂采集的数据同质化严重,还需要无本体采集、真机采集、深入实际场景采集等。目前,国家也推进了场景落地相关政策,推动机器人像“学徒工”一样到实际场景中进行训练。


因为机器人泛化能力还未突破,所以目前机器人的落地是渐进式的:第一阶段,先在半结构化和结构化场景落地;第二阶段是在商业服务场景落地(例如,导购导览、冲咖啡等),这还需要时间迭代;第三阶段是在家庭场景落地,这至少要3年,甚至5年以后。


要强调的是,落地是分阶段的,但针对不同场景的技术积累一直在进行。


贝壳财经:预计具身智能的“ChatGPT”时刻何时到来?需要解决的关键性问题是什么?


唐剑:针对“ChatGPT时刻”没有严格定义,我的理解是:机器人进入陌生环境,能对任意给定的任务,以较高成功率执行,这就是“ChatGPT时刻”。


目前,算力已经不成问题,但算法模型架构还远未收敛。3年内,机器人在算法泛化能力上一定会有重大突破和进展。世界模型让大家看到希望,但在物理世界干活和在数字世界干活截然不同,所以即便算法泛化能力实现突破,也并不意味着“ChatGPT 时刻”的到来。


新京报贝壳财经记者 程靓 编辑 陈莉 校对 穆祥桐