跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

Ilya Sutskever:从 scaling 时代走向研究时代


Ilya Sutskever认为AI正从规模扩展转向研究驱动,当前模型在评估中表现优异但经济影响滞后,未来将深刻渗透经济。

伊利亚·苏茨克维是OpenAI的联合创始人、前首席科学家,没人比他更清楚大语言模型是怎么“长”出来的。但在最近一次对谈中,他反而少了些技术乐观,多了些冷静的审视。他与另一位研究者聊到了一个让人有点不安的现象:眼下AI模型在各种考试里分数越来越高,可一到了真实任务——比如帮程序员修个bug——常常犯低级错误,甚至陷入“道歉—引入新bug—再道歉—退回原bug”的死循环。这种“评测评能、干活不行”的反差,让伊利亚确信,单纯堆算力、堆数据的“规模扩展”时代正在结束,AI必须转向真正以研究驱动的阶段。

伊利亚的核心主张很直接:现在模型的考试高分化表不了真实能力,而AI的经济影响力也还没真正爆发,这背后有深层原因。他提到,眼下全球AI投资已占到GDP的1%左右,规模堪比一场技术革命,可普通人生活里几乎感觉不到变化。有人把这叫做“慢起飞”,甚至觉得就算到了技术奇点那一天,大家可能也只是耸耸肩。但伊利亚不同意,他认为这股力量最终会通过经济渠道渗透进每个行业,只是现在还处在非常早期的渗透期,当重塑真的发生时,冲击会非常剧烈。

最能佐证这种“脱节”的,是那个修bug的例子。一款前沿模型能通过高难度编程测试,但当你让它改正一段代码里的错误,它先是很有礼貌地承认问题,然后给出一个看似合理的修复,结果却带进一个新错误;你再指出新错误,它又道歉,并再次给出修复,可仔细一看,恰恰又把代码退回了最初的状态。这就像一个人每次犯错都说“对不起我改”,可改来改去原地打转。伊利亚和对话者给出两种解释:一是模型的微调阶段,比如用人类反馈做强化学习,可能把它的注意力训练得过于聚焦某些维度,却在基本逻辑一致性上变得迟钝;二是预训练时模型“来者不拒”地学遍互联网数据,虽然知识广,但没有形成扎实的认知结构,一到没见过的情境就容易出错。换句话说,现在的模型更像是一个超级模仿者,而非真正具备推理能力。

当然,也有不同看法。一种声音认为,技术扩散本来就有滞后,电力、互联网从发明到改变日常生活也花了几十年,现在AI的经济影响还没显现并不奇怪。也有人觉得,评估基准本身就可能不准,未必代表真实能力;而且人类程序员写bug、改bug又出新bug也很常见,不能因为AI犯了类似错误就否定它。但伊利亚更关注的是这种失败模式背后的失调——如果AI只是靠统计匹配在答题,那它永远学不会稳定地解决新问题,这也意味着用AI撑起一轮经济变革的预期可能落空。

说到底,伊利亚想提醒的是,AI要真正进入“研究时代”,就得从堆规模转向攻克那些让模型不光“知道答案”、还能“清楚自己在做什么”的根本难题。只有当模型能在开放世界里稳定输出,考试里那个漂亮的分数才值得信赖,而经济层面的大戏也才能拉开帷幕。听完这些,你会对眼下各种AI里程碑多一层思考:它们到底是智慧的起点,还只是一面高分的镜子?

更多 · Ilya Sutskever