跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

Demis:从游戏到科学


用AI打游戏的经验,如何帮科学家更快发现新药和新材料。

Demis Hassabis,DeepMind 的创始人兼 CEO,最近在 Crick Insight Lecture 上做了一场演讲,题目是“用 AI 加速科学发现”。你可能知道他最早是下棋的天才少年,后来去剑桥念了神经科学,再后来创办了 DeepMind,带着团队用强化学习玩 Atari 游戏,又做出了打赢李世石的 AlphaGo。但现在他的兴趣早已不在游戏上——他要回答一个更大的问题:那些在虚拟世界里打磨出来的算法,怎么变成科学家的加速度,快一点找到新药、新材料?他在讲座里给出了一个直白的预测:大概到 2027 年,我们就会看到能独立完成博士级别科研任务的 AI 系统。这不是科幻,而是他根据过去几年技术曲线的实用判断。

他不喜欢纠缠 AGI 的定义。他说的 powerful AI,门槛就是“能干博士水平的活儿”——比如读文献、设计实验、分析数据、提出假说,而且不是偶尔灵光一闪,是持续、可靠地输出。一旦这个门槛被迈过去,哪怕有人争辩“这还不算 AGI”,制药、材料、能源这些行业的地板就已经被抽掉了。Demis 自己的履历就是这个推演的注解:从用神经网络学会玩《太空侵略者》,到 AlphaFold 一举破解困扰生物学 50 年的蛋白质折叠难题,他每一步都在把游戏引擎里训练出来的智能迁移到真实世界的复杂系统上。用他的话说,游戏提供了一个完美的试验场,动作序列、奖励信号、庞大的搜索空间——这些恰好也是科学发现抽象出来的结构。

讲到这里,他开始拆具体的技术管道。AlphaGo 的蒙特卡洛搜索树,本来是在棋盘上推演胜负,后来被改造成在分子构象空间里找最低能量态;AlphaZero 的自对弈,学会了不用人类棋谱就能进化出超前策略,同样的框架用在材料基因组上,能自主组合元素周期表里的排列,预测新的超导体或催化剂。他轻描淡写地提到,DeepMind 现在内部有一套从游戏迁移过来的“科学发现工程”:先用生成模型补足稀缺数据,再用自监督预训练抓取物理化学规律,最后用强化学习驱动探索。很多人担心芯片不够用,Demis 承认算力是物理瓶颈,但他更在意的不是硬限制——到 2027 年前,最紧的那一块其实是数据质量和算法效率,还有团队组织能力。他们正在把每一块推得更薄。

不过他也不是只谈光速前进。安全这个话题被他在讲座中间拎出来,打了个反直觉的底。通常的想法是:等我们做出更强的东西再考虑怎么管住它。Demis 摇着头说过好多次:安全研究不是 AGI 之后的补丁,是整个过程里就长在骨头里的东西。从早期的强化学习人类反馈(RLHF),到后来的宪法式 AI,他和团队把 alignment 做成了一套会自己迭代的工程机制。这听上去有点抽象,说白了就是让 AI 在一层又一层的约束里学会不与人的本意走岔。商业模式上也透着这种克制:他选择用 API 把底层智能能力供给出去,而不是自己冲上去做消费者应用。想想看,这相当于把应用层的想象力交给了整个生态,但要命的是,万一哪个下游用歪了,你修复起来反而更绕。所以他在 API 层就嵌进了安全护栏,宁可现在多费事,也不要五年后回头补窟窿。

结尾的时候,他把时间线摊开来:未来五年,不抢 AGI 竞赛的第一名,要抢安全曲线上的先手。他特别提到政策上的配合——呼吁出口管制不是为了掐死技术,而是给对齐研究多留出几年缓冲。坐在台下的很多学生可能还在想,玩游戏怎么就成了科学的加速器。但 Demis 要说的恰恰是,早年他趴在棋盘上和游戏机前面学到的,远不只是几个算法,而是一整套快速试错、持续优化的工程文化。在科学探索的尺度上,这种文化正变成最稀缺的燃料。五年之后回看今天,也许 AlphaFold 只是个序章,真正的故事是:一群反复在虚拟世界里折腾出来的方法论,正在把人类最难的现实问题调成倍速。

更多 · Demis Hassabis