机器人2026世界人工智能大会 人工智能机器人 智能机器人 人形机器人 激光雷达是智商税吗 大模型 :《机器人拿不住那杯水:WAIC2026揭示的物理AI生死线》 七月上海,热浪与冷气在世博中心门口形成奇异对流。走进2026世界人工智能大会(WAIC)展厅,迎面而来的不是屏幕,是机器人。大批国产人形机器人散布于场馆各角落,专门给观众指路。它们的动作已无早年原型机的笨拙感,参观者拍照、围观,气氛热络。
在这场视觉盛宴的背面,产业内部正进行一场更深层、更安静的自我审视与革新。
这届WAIC与往年最大的不同,在于评价体系的迁移:投资人和工程师不再追问机器人"能不能跳舞",开始逼问"能不能在真实场景里干活"。雅可比机器人创始人邱迪聪说了一句话,颇具代表性:"无论多厉害的技术、多好的设计,到最后都需要形成一个可交易的产品,才能产生最终的经济价值。"
2026年,整个赛道正式跨入"实干期"。而实干,首先撞上了两堵看不见的墙。
一、两堵墙:Z轴置信度与物理世界理解赤字让机器人从桌上拿起一杯水,听起来是最简单不过的任务。但如果只用平面视频训练它,大概率会发生这样的事:它伸手,抓翻了前面那只挡路的杯子。
平面摄像头丢失了Z轴,也就是深度信息。速腾聚创市场部总监谢阗地用一个更直白的例子说明这个问题:"桌上有两杯水,你要拿后面那杯,机器人的脑子需要理解水杯的前后关系、大小关系。如果只靠平面视频训练,机器人学不明白——今天用大球训练,明天遇到小球,机器人就不知道怎么处理了。"
这与自动驾驶场景的结构性差异,构成理解具身智能难度的关键参照。车载场景相对结构化,汽车主要识别前方行人和车辆,算出距离再避让或刹车即可;机器人操作涉及的是在非结构化三维空间里完成精细交互,认知负担截然不同。谢阗地将这个差异直接挑明:自动驾驶只需要"算出来并避让",但机器人要完成"理解"。
快思慢想研究院院长田丰将感知端的核心问题精确定义为:"Z轴信息的实时置信度"——机器人能不能在每一帧里,准确知道眼前每个物体离自己多远,而且判断这个距离数据是否可以被信任。工业机器人之所以高度精准,是因为它工作在已知坐标系里,光照恒定,障碍物静止。而物理AI面对的是持续变化的三维世界——行人闯入、光线骤变、镜面反射、透明玻璃。在每一帧内,它必须以毫秒级速度重建一个足够精确且可信的三维置信场,再喂给决策模型。
传统摄像头丢失Z轴;毫米波雷达分辨率太粗,无法区分行人和金属柱;传统机械旋转激光雷达帧率约10Hz,MEMS半固态已进步到25Hz,但面对人类行走速度1.5m/s、机器人操作臂末端可达3至5m/s的高速动态场景,感知延迟的累积足以直接导致决策失效。精度、速度、鲁棒性,三角约束同时压下来,传统线扫架构从根本上无法同时满足。
这是感知端的硬壁垒。计算端同样存在软肋——邱迪聪指出:"核心是大模型对物理世界的理解能力还存在明显不足。"很多人类能直观感知的物理现象、物理交互过程,物理AI还没有足够的对应数据来完成学习。感知缺乏置信的深度数据,计算缺乏物理交互的训练样本,两堵墙叠在一起,构成了2026年物理AI商用化的核心制约。 机器人拿不住那杯水:WAIC2026揭示的物理AI生死线