跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

谭捷:机器人、跨本体、世界模型、Gemini Robotics 1.5


谭捷认为机器人领域正经历从强化学习到大模型的两个范式转变,当前机器人大模型仍是大语言模型的延伸,但未来可能成为独立学科。

今天的嘉宾谭杰是Google DeepMind机器人团队的高级研究科学家,他在节目中分享了自己从计算机图形学转向机器人研究的奇妙旅程,以及机器人领域过去十年里两次重要的范式转变。

谭杰博士曾在上海交大攻读图形学,做过动画,甚至在皮克斯实习过。那时他专注于让虚拟角色在物理仿真中自然运动,逐渐发现里面的AI算法与机器人控制惊人地相似。2015年加入谷歌后,他发表了第一篇用深度强化学习让四足机器人学会行走的论文,开创了“从仿真到真实”的路线。这彻底改变了机器人运动控制:以前需要手调复杂数学模型,现在只需在仿真里训练AI,再迁移到真实机器人,波士顿动力的炫技表演很快就不再是独家绝活,如今就连开源的人形机器人都能翻跟头、跳舞。这就是第一个范式转变——用强化学习解决机器人的“小脑”问题。

第二次转变来自大语言模型。2018年AlphaGo的强化学习还只是下棋,但近年GPT、Gemini等多模态模型让机器人拥有了“大脑”。它们不仅能听懂人类用自然语言下指令,还能理解常识,把“做一杯咖啡”拆解成一步步详细规划。谭杰的团队刚刚发布的Gemini Robotics 1.5就利用了“思维模型”,让机器人在执行任务时能“思考”和推理。不过他也指出,目前的多模态大模型还缺一环——不能直接输出控制动作,因此大家主要是在这些大模型基础上做微调,添加机器人动作数据,使其能指挥身体。这听起来简单,实则远未达到独立的“机器人大模型”,更多是现有技术的延伸。

然而,理想丰满,现实骨感。谭杰坦言,虽然过去一年半进展飞快,硅谷所有大公司都在重金押注,人才从周一卷到周日,但通用机器人的真正落地还有巨大鸿沟。最大的瓶颈是数据:互联网上文字唾手可得,可让机器人学会在纷繁复杂的物理世界中灵活操作,需要海量且多样化的数据,目前这类数据极度稀缺。虽然有公司通过遥操作、仿真采集数据,但还远不足以喂饱模型。此外,即便某个任务能做到90%成功率,像拉拉链这种精细活可能只有30%~40%,远未达到商用标准。从演示到产品,他估计至少还要5到10年,就像自动驾驶从DARPA挑战赛到Waymo上路走了十几年。

最后,谭杰聊到了一个哲学问题:到底该做通用人形机器人,还是一个领域一个领域地去攻克专用机器人?他觉得两条路都没有错,但世界的发展往往不是理性推演的。一位有远见的“大佬”(比如马斯克式的人物)一旦笃定通用人形是终极方案,资金、人才就会涌入,从而倒逼这条路成为现实。他本人更倾向于相信,正如语言领域通用模型最终碾压专用模型,机器人或许也会走上类似的路径。节目末尾,他依然充满期待:虽然眼看百业待兴,但只要数据、算力、算法持续突破,机器人真正走进千家万户的日子可能并不遥远。

继续阅读 · 最新精选