世界人工智能大会(WAIC)刚刚过去,在4天的展览和论坛时间里,AI与具身智能上下游的从业者、投资人、创业者被高密度“压缩”在世博场馆中,共同谱写了一曲中国科创前沿的交响乐,这个乐章正持续演奏,走向高潮部分,主旋律名为具身智能。
“我从来不敢在我的职业生涯中想象到的,一个领域在两年到三年中诞生了300多家企业,这个密度太高了。这些企业成立时间短则一年,长则三年,现在有10家企业是200亿元人民币左右的估值,有20家企业是100亿左右的估值,估值上升非常快。”在世博中心银厅里,启明创投主管合伙人周志峰说。
但当行业人士为具身智能的发展欢欣鼓舞时,展会中机器人慢悠悠的动作越来越难以满足已经看腻了表演的观众,“不过就是个大玩具”“缺乏实用性”的评论不绝于耳。
一边是行业人士兴奋于技术爆炸前夜、资本争相涌入,一边是观众对机器人“习以为常”。2026年7月,机器人到底落地到了哪一步?对此,新京报贝壳财经记者体验了多个机器人项目,并采访了具身智能领域的创业者、投资人,为读者剖析具身智能风口为何而热,以及令资本和人才蜂拥而至的到底是什么。
热闹背后:机器人是“玩具”吗?
在世博展览馆,一层进门处的“摩登时代”展区和二楼的H3展区成为机器人的秀场,展出的机器人可谓“五花八门”,类型有人形机器人、机器狗、载人机甲、重载机器马,体验项目有机器人打乒乓球、机器人踢足球、机器人按摩、机器人拍照,你甚至还能骑机器人。
经过一年的技术发展,越来越多的机器人不满足于只待在自家展位上,在整个世博展览馆二层,你能看到双足轮式机器人在场馆内穿梭并表演原地“转陀螺”,打扮成动漫角色样子的COSER用绳牵着机器狗逛展,各种大小的人形机器人都能随地给人来上一段“尬舞”,可谓“八仙过海各显神通”。说明机器人已经逐步落地到了日常生活中,泛用性相比一年之前再次得到了加强。

世博展览馆2层,一名COSER向记者演示通过语音指令让机器狗跳舞。新京报贝壳财经记者罗亦丹/摄
“展馆里有很多机器人可以互动,但让我印象最深刻的还是宇树的GD01,大概一个月前,我在社交媒体上刷到过这个巨大的变形机甲。刚刚我在展馆里看到了它,确实让我大吃一惊,因为我年轻的时候最喜欢的电影是《机器战警》,看着它就像机器战警在我面前‘活过来了’一样。”英国籍跨境商贸从业者西蒙在接受贝壳财经记者采访时难掩激动的心情。

英国籍跨境商贸从业者西蒙正在和机器人合影。新京报贝壳财经记者罗亦丹/摄
但需要注意的是,在速度和效率的比拼上,从演示效果来看,目前展出的机器人鲜有直观上能够达到人类或者工业机器人水平的。这也遭到了不少网友的“吐槽”。在记者发布的一条试驾机器马的视频下,几乎八成的评论都带着调侃的语气。“这不就是个大玩具吗”“手扶拖拉机不比这个实用”?
如果看落地应用的机器人呢?比如在一个展示机器人分拣快递包裹的展位上,记者发现,机器人可以通过视觉锁定包裹,精准抓取并放到指定位置,但动作明显比人类或流水线上执行固定作业的工业机器人慢上不少。
这样的机器人有什么用?聆动通用机器人创始人兼CEO季超解答了记者的疑惑,“我们切入的并非工业机械臂擅长的高节拍作业场景,而是容错率高、节拍要求低的场景。例如前置仓夜间分拣,这类场景只需要机器人在8小时夜班周期内完成订单分拣与派发,不需要高速作业,可直接替代人工夜班岗位。这类场景对作业节拍要求不高,已经具备了商业化落地基础。”

聆动通用机器人创始人兼CEO季超向记者解释机器人的实用性问题。新京报贝壳财经记者罗亦丹/摄
季超告诉记者,一些客户本身存在创新的诉求,希望用更灵活的新型设备解决现场问题,“比如很多仓库租期仅1到2年,传统工业机械臂部署偏重,需要做场地重度改造,搬迁时的拆除、异地重装都会产生额外成本。此时可移动、可作业的轮式人形机器人,本质上降低了客户的场地迁移与改造成本,更符合轻部署的行业趋势。”
“当下具身智能技术还只能完成一些相对简单的任务,这些任务到底应该先落地什么产业、什么场景至关重要,而中国能提供最全面、最丰富的落地场景,可以让我们优秀的创业公司跟产业方一同去试落地。”周志峰说。此外,他还提到了另一个关键点:“一个170cm以上的全尺寸人形机器人的零组件有大约1200个,除了CPU和GPU,剩下绝大部分组件全部是在中国长三角和珠三角两大产业集群生态中提供,很多投资方都注意到了中国在机器人硬件领域的优势。”
真正的战场已转移到“大脑”
具身智能的真正进展,往往藏在普通观众看不见的角落。
贝壳财经记者走访WAIC展台发现,如果要论展示最多的场景,当数“采药”,记者在至少四个展台看到了机器人在药房分拣药品的应用演示——机器人慢悠悠地走到货架上,取得药品,再拿到前台,完成一个动作闭环。其逻辑和上文中所述相同——一些24小时药房需要晚间值守,并且等候顾客和拿药的过程导致不像工业场景那么强调节拍与效率,因此更加适合人形机器人的部署。

不同品牌的机器人搭载了同一个具身“大脑”,正在进行采药任务。新京报贝壳财经记者罗亦丹/摄
但在蚂蚁灵波的展位,记者看到三台不同品牌、不同构型的机器人正在执行同一个“采药”任务,三台机器人由蚂蚁灵波自研的同一套通用大脑驱动,在这背后,是当前具身智能领域投资人、从业者们所追求的最火热的目标——具身智能大脑。
蚂蚁灵波科技CEO朱兴接受新京报贝壳财经记者采访时表示,“我们做大脑时侧重于做基础模型,在预训练的时候就加入了约20种机器人的真机数据,所以我们的基础模型已经对这20种机器人非常熟悉了,模型后训练部署到这些机器人身上时就会非常适配。”
蚂蚁灵波科技CEO朱兴在WAIC现场接受新京报贝壳财经记者采访。
目前,为了训练机器人的“大脑”,训练数据的重要性被提到了第一位,哪类数据最重要,训练具身模型时的训练数据要怎样配比,成为不少业内人士关心的重点。
在WAIC开幕之前,大晓机器人董事长王晓刚曾在接受贝壳财经记者采访时“锐评”过各类数据的配比问题,他表示,真机遥操数据受限于具体机器人本体,从某一种本体采集的数据,很难直接推广到其他本体。同时,这类数据通常并非来自真实生产生活环境,积累速度也比较慢。如果主要依靠真机遥操数据,很难支撑具身智能迎来ChatGPT时刻。
而对于其他类型的数据,王晓刚认为,“仿真合成数据具有一定作用,但与真实数据之间仍存在较大的Sim2Real(模拟环境到现实世界)差距,因此更适合作为有效补充。UMI主要依赖末端操作,随着灵巧手等技术发展,我认为它更像是一种中间过渡形态。”
WAIC上,大晓机器人在世博中心承办了一场主题为“物理AI开悟时刻”的论坛,王晓刚在论坛上发布了开悟世界模型 3.1(Kairos 3.1),他表示该模型将视觉观测、语言指令、力触状态、策略轨迹等多维具身数据压缩进统一隐空间,形成高密度表征向量,从底层实现三大能力的原生融合——这或许就是他找到的答案:机器人的大脑需要多维数据的综合训练。
“头部机器人公司的有效数据,将从2025年的‘万小时级’,跃升到2027年的‘百万小时级’,其中人类第一视角数据会占绝对主导。”在预测2026年具身智能行业发展时,周志峰如此判断。
具身智能火爆延至上下游
当具身智能的“大脑”成为行业竞逐的核心战场,围绕这颗大脑的上下游产业链也在悄然生长。具身智能的热潮正在向上游芯片、下游交互方案等环节持续渗透,催生出一批潜在的“卖水人”。
聆思科技专注端侧AI芯片研发,其首款原生端侧大模型AI推理芯片将于年底亮相。该公司市场副总裁韩超阳在接受新京报贝壳财经记者采访时直言,2026年的端侧AI落地需求已经与早年截然不同——行业不再停留在“如何完成智能化升级”的构想阶段,多个领域已经形成了清晰的升级路径,其中具身智能机器人属于核心刚需场景。

聆思科技市场副总裁韩超阳接受采访。新京报贝壳财经记者罗亦丹/摄
韩超阳告诉记者,当前机器人的运动控制能力已较为成熟,可完成各类复杂动作,但“大脑”的智力水平尚未跟上。而端侧GPU普遍存在功耗偏高、成本偏高、性能确定性不足的问题,仍无法充分满足场景需求,“未来随着原生端侧大模型AI推理芯片落地,凭借更小的尺寸、更低的功耗以及数量级提升的推理性能,机器人可真正实现自主执行任务、对现场环境做出实时反应,具身智能才会真正具备规模化的实用价值。”
具身机器人的潜力也让端侧模型获得了前所未有的关注。
由复旦大学孵化,首次参加WAIC的模思智能主打多模态模型,本次参会带来了 MOSS系列多模态基础模型,其中MOSS-Transcribe-Diarize模型参数量仅为 0.9B,适合端侧部署,可一次处理约90分钟多人音频,同时区分不同说话人。
模思智能联合创始人、CEO李世民接受贝壳财经记者采访时表示,团队追求的是“情景智能”,即“当模型进入真实世界,关键不只是识别声音和画面,而是理解这些信息在什么情境中发生,并据此判断何时回应、如何回应。”
蚂蚁灵波科技CEO朱兴在WAIC现场接受新京报贝壳财经记者采访。
目前,为了训练机器人的“大脑”,训练数据的重要性被提到了第一位,哪类数据最重要,训练具身模型时的训练数据要怎样配比,成为不少业内人士关心的重点。
在WAIC开幕之前,大晓机器人董事长王晓刚曾在接受贝壳财经记者采访时“锐评”过各类数据的配比问题,他表示,真机遥操数据受限于具体机器人本体,从某一种本体采集的数据,很难直接推广到其他本体。同时,这类数据通常并非来自真实生产生活环境,积累速度也比较慢。如果主要依靠真机遥操数据,很难支撑具身智能迎来ChatGPT时刻。
而对于其他类型的数据,王晓刚认为,“仿真合成数据具有一定作用,但与真实数据之间仍存在较大的Sim2Real(模拟环境到现实世界)差距,因此更适合作为有效补充。UMI主要依赖末端操作,随着灵巧手等技术发展,我认为它更像是一种中间过渡形态。”
WAIC上,大晓机器人在世博中心承办了一场主题为“物理AI开悟时刻”的论坛,王晓刚在论坛上发布了开悟世界模型 3.1(Kairos 3.1),他表示该模型将视觉观测、语言指令、力触状态、策略轨迹等多维具身数据压缩进统一隐空间,形成高密度表征向量,从底层实现三大能力的原生融合——这或许就是他找到的答案:机器人的大脑需要多维数据的综合训练。
“头部机器人公司的有效数据,将从2025年的‘万小时级’,跃升到2027年的‘百万小时级’,其中人类第一视角数据会占绝对主导。”在预测2026年具身智能行业发展时,周志峰如此判断。
具身智能火爆延至上下游
当具身智能的“大脑”成为行业竞逐的核心战场,围绕这颗大脑的上下游产业链也在悄然生长。具身智能的热潮正在向上游芯片、下游交互方案等环节持续渗透,催生出一批潜在的“卖水人”。
聆思科技专注端侧AI芯片研发,其首款原生端侧大模型AI推理芯片将于年底亮相。该公司市场副总裁韩超阳在接受新京报贝壳财经记者采访时直言,2026年的端侧AI落地需求已经与早年截然不同——行业不再停留在“如何完成智能化升级”的构想阶段,多个领域已经形成了清晰的升级路径,其中具身智能机器人属于核心刚需场景。

聆思科技市场副总裁韩超阳接受采访。新京报贝壳财经记者罗亦丹/摄
韩超阳告诉记者,当前机器人的运动控制能力已较为成熟,可完成各类复杂动作,但“大脑”的智力水平尚未跟上。而端侧GPU普遍存在功耗偏高、成本偏高、性能确定性不足的问题,仍无法充分满足场景需求,“未来随着原生端侧大模型AI推理芯片落地,凭借更小的尺寸、更低的功耗以及数量级提升的推理性能,机器人可真正实现自主执行任务、对现场环境做出实时反应,具身智能才会真正具备规模化的实用价值。”
具身机器人的潜力也让端侧模型获得了前所未有的关注。
由复旦大学孵化,首次参加WAIC的模思智能主打多模态模型,本次参会带来了 MOSS系列多模态基础模型,其中MOSS-Transcribe-Diarize模型参数量仅为 0.9B,适合端侧部署,可一次处理约90分钟多人音频,同时区分不同说话人。
模思智能联合创始人、CEO李世民接受贝壳财经记者采访时表示,团队追求的是“情景智能”,即“当模型进入真实世界,关键不只是识别声音和画面,而是理解这些信息在什么情境中发生,并据此判断何时回应、如何回应。”
模思智能联合创始人、CEO李世民在WAIC现场接受新京报贝壳财经记者采访。
“这次大会,机器人赛道热度很高,具身智能也是我们合作方向之一,我们核心的智能技术主打复杂场景下的感知与理解能力,并基于感知结果完成智能输出与人机交互。这类交互能力天然需要依托硬件载体与物理世界形成联动,正因如此,具身智能也是落地我们交互技术愿景的绝佳载体。”李世民告诉贝壳财经记者。
“在今年WAIC展厅中,最热的是物理AI,无论是机器人还是其他智能终端,它的本质就是能够实现物理世界中的作业,可以是在工厂场景、服务场景、养老场景、个人陪伴场景等,AI通过物理载体去完成作业。当AI在物理世界的作业实现之后,人类社会的物理劳动力将极度充裕,我认为这是人类发展历程中,技术对经济和社会形态最底层的一次变革,变革的激烈程度会超过工业革命、信息革命等过去所有的技术浪潮。”周志峰说。
记者联系邮箱:luoyidan@xjbnews.com
新京报贝壳财经首席记者 罗亦丹
视频 罗亦丹
编辑 岳彩周
校对 柳宝庆






