跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

杨植麟:Kimi K2、Agentic LLM、缸中之脑与无限的开端


杨植麟认为AI发展如同攀登无尽雪山,通过强化学习实现推理和智能体能力,问题不断产生又不断解决,AGI是方向而非终点。

各位好,我是小骏,今天再次与月之暗面创始人兼CEO杨植麟对谈。距离上次深度报道《杨植麟复盘大模型创业这一年:向严明而未知的雪山前进》刚好一年,站在2025年7月,杨植麟的感觉是“既更清晰了些,又依然面对一片未知”。他始终用“爬雪山”比喻AI研发——你可能又往上走了几百米,解锁了新的场景,但抬头看,技术问题照样茫茫一片。只是这次,他已经不把终点锁定在某个叫AGI的台阶上,而是看作一条没有尽头的上坡路。

这一年来最大的变化,是模型从“只答一句话”到“能持续干几个小时的活”。两年前,让模型写篇像样的文章都费劲;如今K2可以克隆代码仓库、翻译语言、修bug、自动测试,一气呵成。杨植麟认为,质变来自强化学习:模型学会了像人解题那样,不断提出猜想、自我验证,而不是一次性输出。他称之为“test-time scaling”(测试时规模化)——推理阶段投入更多算力,生成更多思考token,从而完成复杂任务。这有两条路径:一条是“鱼缸中的大脑”,模型不与外界交互,只在内部反复推演,典型如OpenAI的o1;另一条是agent,模型像人一样使用浏览器、写代码、调搜索,通过多轮交互从环境获取反馈。两者其实都在把“单次回答”延展成“线性甚至并行的问题求解过程”,杨植麟觉得它们不是先后顺序,而是可以并行的技术维度。

这两条路径也投射到产品开发上。以前很多第三方用基础模型搭脚手架,逆向猜测训练时的工具和指令;现在模型公司自己做一方产品(如Claude Code、GPT Agent),直接在训练环境里整合工具,让模型天然擅长使用它们。杨植麟承认,月之暗面目前主力仍是模型,但对一方产品趋势保持观察。他还比较了OpenAI定义的L1到L5路线:L1聊天机器人、L2推理者、L3智能体、L4创新者、L5组织者。在他看来,推理和智能体未必是刚性依赖,但若想做到最好,二者必须都强,然后模型才可能参与自身研发(L4创新),并衍生出多智能体协同(L5组织)。但这也不像上台阶,更像几个能力同步提升。

在技术细节上,杨植麟提到K2的重点是提升“token efficiency”(数据效率),即让每一份训练数据都最大限度地增长智能。他举了优化器的例子:主流Adam优化器用了十年,但对token的利用率不够高;他们改用Muon优化器,把参数矩阵整体考虑,而非逐元素更新,从而用同样多的数据学出更强的模型。这背后是“高质量数据增长缓慢”的瓶颈,只能靠算法创新去挖掘已有数据的潜能。

访谈末尾,杨植麟把AI研发比作启蒙运动后的动态社会:问题不可避免,但问题可以解决;每解决一个问题就拓展知识边界,同时生出新问题,如此往复,创新不止。他并不急于宣布某个时间点实现了AGI——蒸汽机改变社会用了几十年,AI对社会结构的重塑同样需要漫长消化。而他的追求就是持续攀登,看着身边景致逐层不同,并期待这座雪山永远没有尽头。

更多 · 杨植麟