Skip to content

0822|王兴兴宇树上市后演讲:机器人前沿的5点思考

4
2026-08-22

摘录一下王兴兴在宇树上市后的高质量演讲,共 5 点。我觉得非常有价值,看完这几句话,基本上就已经站到了机器人的最前沿。对炒股不一定有用,毕竟现在的人形机器人在机械结构上有巨大突破,但在智能上还差一个很大的突破:

最主要的原因,就是目前机器人的效率和泛用性还不够。

简单来说,虽然目前机器人已经能够做一些简单的装配,但它的效率和人相比还是更低一些。另外,每次有新的任务过来,还需要重新进行训练,整个部署效率也比较低。

所以我希望,快的话可能两到三年,慢的话可能五年或者十年。

评价具身智能具备真正通用能力的指标也非常简单。把机器人带到 80% 左右的陌生场景里,通过语音和语言指令,它可以完成 80% 左右的任务,我觉得这是一个非常重要的临界点

2、目前机器人基本都是 AI 驱动,而 AI 目前又基本是数据驱动。有多少数据,尤其有多少高质量的数据,很大程度上决定了 AI 能够做到什么程度。

所以我们也在自己采集数据,或者和第三方公司合作,给大家使用,也给我们自己使用。

数据驱动仍然是非常重要的一件事情。我个人认为,真正的 AI 机器人训练数据,还是需要海量的真人数据或者互联网数据作为主要的预训

练数据,再加上一部分真机数据。这是两类非常刚需的数据。

3、我们过去做很多常规的机器人动作演示,基本都是提前训练好的。但这部分动作是基于实时语音生成的。

具体来看,一句话说完以后,首先要进行语音识别,识别以后上传到云端,再由云端进行 AI 动作生成。

动作生成以后,还要进行一些动作验证,确认没有问题以后再下发给机器人。所以整个过程目前还需要几秒钟的延迟。

4、目前 AI 模型的输入和输出, 与真实机器人的对齐程度还不够。

比如让机器人移动,把一些东西装配在一起,或者把一个物体搬到另一个位置。从大的趋势

来看,现在的模型其实没有太大问题,大差不差能够执行你的任务。

问题往往发生在最后几个厘米,甚至最后几个毫米。机器人去拿一个东西的时候,看起来已经快要拿住了,但是最后一点点误差,它没有办法很好地修正,这就会导致整个任务的成功率严重下降。

为什么机器人模型会出现这个问题,而在一般的语言模型或者多模态模型上表现却没有这么明显?

因为语言模型处理的信息,本身就是数字编码的。一个文字输入是什么、输出是什么,它严格限制在一个向量空间里面,基本不会产生特别大的偏差。

简单来说,它不会产生现实世界中的物理误差。但是对于机器人来说,每进行一次输入和输出,都可能存在偏差和损失。

5、公司最近一段时间正在推动的一件事情,就是直接让物理 AI 机器人模型实现自进化。

我们自己设定一些规则、经验、约束和工具,让 AI 自己去网上搜索最新的论文、最好的研究成果,以及各种优秀的开源方案,然后自己去编程,生成机器人的控制代码。

控制代码生成以后,可以先放到仿真环境里面运行,也可以调用一些大模型,然后再去控制实物机器人。等真正部署到实物机器人后,我们再进行测试、评价和打分。

  • 0

评论