这段视频来自播客节目《张小俊商业访谈录》,主持人张小俊和广秘对话OpenAI研究员姚顺宇。姚顺宇毕业于清华姚班和普林斯顿大学,博士期间很早就开始研究基于语言模型的智能体(Agent),至今已有六年。他在2025年4月发表了一篇有影响力的博文《The Second Half》,宣告AI主线程进入下半场。这次访谈从他个人经历出发,深入探讨了AI智能体的历史、现状和未来,以及语言在其中的核心作用。
姚顺宇的核心主张是:语言是实现通用人工智能(AGI)最本质的工具,因为任何事情都可以用语言表示。他回顾了AI智能体的三波浪潮:第一波是符号主义,通过手工编写规则构建智能体,但很快遇到瓶颈——规则无法覆盖所有情况,且无法跨任务泛化,导致了第一次AI寒冬。第二波是深度强化学习,以AlphaGo为代表,能在特定环境中通过大量试错学习,但同样无法泛化到新环境,且需要大量环境特定的工程。第三波始于大语言模型(LLM),模型通过预训练获得了丰富的语言先验知识,具备了推理能力,从而能泛化到新任务。他认为,LLM带来的推理能力是智能体实现泛化的关键,也是与前两波的本质区别。
姚顺宇分享了自己的研究历程,强调“非共识”和“简单通用”的重要性。他最早意识到环境的重要性,因此创建了WebShop环境,让智能体在模拟电商网站中学习。随后,他提出了ReAct框架,将推理与行动结合,成为当前最通用的智能体架构之一。他回忆,当时学术圈更关注训练模型(如BERT),而他认为研究如何使用模型(如通过提示工程)更有价值,因为训练模型往往落后于OpenAI等公司数年。他最喜欢的作品是ReAct,因为它简单、通用,且标志着范式转变——从“训练模型”转向“使用模型”。他还指出,智能体研究有两条线:方法(如ReAct)和环境(从游戏到互联网、代码等数字环境),二者相辅相成。
关于OpenAI的五个分级(聊天机器人、推理者、智能体、创新者、组织者),姚顺宇解释其内在逻辑:先有语言先验知识,才能做对话机器人;有了推理能力,才能做智能体;下一步是让智能体拥有自我奖励和探索能力,以及多智能体协作形成组织。他认为,提升智能体能力最关键的维度是处理上下文(Context)的能力,即记忆和在线学习能力。对于环境,他特别强调代码环境的重要性,认为代码就像人的手,能提供闭环反馈和验证,是通往AGI的重要路径。
访谈也触及了反方观点和局限。姚顺宇承认,当前智能体仍面临挑战,比如环境依赖、泛化能力有限,以及技术成熟度问题。他提到,早期做智能体研究时,技术尚未成熟,大多数人仍在做问答或翻译等任务,智能体研究并非共识。但他坚持自己的“非共识”判断,认为正因为技术不成熟,才是开始的好时机。他提醒,智能体的未来不仅需要方法创新,还需要更真实、更具挑战性的环境。
总体而言,姚顺宇的讲述展现了一位前沿研究者的思考:从个体经历出发,勾勒出AI智能体从符号主义到深度强化学习再到LLM时代的演进脉络,强调语言和推理的核心地位,并指出简单通用方法的价值。他对未来的展望——自我奖励、多智能体组织、代码环境——为听众提供了理解AI下半场的关键视角。



![[CVPR'23 WAD] Keynote - Jiyang Gao, Momenta](https://i.ytimg.com/vi/hFQLJIvdQNU/maxresdefault.jpg)