跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

Constitutional AI 是什么


这期讲如何用一套规则让AI自我改进,避免有害输出。

Dario Amodei 是 Anthropic 的 CEO,也是圈内最早把“AI 安全”当作工程问题来死磕的人之一。最近在一场关于 Constitutional AI 的访谈里,他不光解释了怎么用一套规则让 AI 自我改进、避免有害输出,还第一次给出了一个非常具体的时间表:大约到 2027 年,我们就会看到能完成博士级别科研工作的 AI 系统。

这个时间点不是拍脑袋想出来的,而是基于他对算力、数据、算法和组织能力的综合判断。在他看来,AI 能力的爆发式增长已经是一个物理上的趋势,但什么时候会跨过“有用”到“改变世界”的门槛?他的锚定标准很实际:不是去争 AGI 的定义,而是看 AI 能不能持续、可靠地完成那些需要多年博士训练才能搞定的任务。他举了个更高阶的例子——诺贝尔奖级别科学家的研究能力。他认为,当 AI 达到这个水平时,整个世界的运作方式就会被改写,因为科研、工程、甚至社会决策中最高难度的脑力劳动都可以被自动化。而这一切,可能就在五年之内。

但 Dario 也强调,真正的瓶颈不是很多人担心的芯片和算力。他说,芯片虽然是个物理限制,但至少在 2027 年前不会卡住脖子,因为算力指数的增长还能撑一阵。真正的硬骨头是数据怎么高效利用、算法怎么更聪明、以及整个组织有没有能力把研究和工程协同起来。所以 Anthropic 的整个打法,就是让“对齐”(让 AI 的价值观和行为符合人类意图)和“规模扩展”(把模型做得更大更强)像两条腿一样同时往前走,而不是先做大再想办法管。这种思路最典型的产物就是 Constitutional AI。简单来说,它不给 AI 每一个回答都找人类来做反馈(那样太慢也太贵),而是先写一套类似宪法的原则,让 AI 根据这套原则自己生成回答、自己评估好坏,然后反过来优化自己。这就像一个教练只给大原则,运动员自己去练、自己去纠错,而不是教练盯着每一下动作。这么做的好处是,AI 内化了一种稳定的“价值观”,遇到没见过的敏感问题时也能按规则自我约束,不至于胡言乱语或被轻易越狱。这套方法不只用在安全上,实际上也成了 Anthropic 做模型能力迭代的核心引擎——因为自我改进的循环一旦跑起来,模型既能变安全也能变强。

在商业模式上,Anthropic 的选择也很清楚:API-first,不做消费者端应用。Dario 的逻辑是,他们最擅长的是底层模型的智能体能力,而不是做 App 的用户体验、增长和留存。把消费者应用层留给整个生态,自己专心把 API 做好,让开发者、企业去构建各种场景的产品,这既是一种能力上的自知,也是一种战略上的克制。但克制不代表没有压力——如果模型本身不够强,或者 API 服务不稳定,就会迅速被竞争对手吃掉。另外,应用层的安全他们不可能完全控制,所以也必须靠提升模型的对齐水平来减少下游滥用风险。Dario 还谈到政策层面的出口管制。他认为,对高端芯片和 AI 技术的管制,目的不应该是把技术封锁起来,而是给对齐研究争取时间。因为在他描绘的图景里,如果 AI 的能力真的在五年内冲到博士级科研水平,但安全研究还没跟上,那风险就会指数级放大。所以,管制是一种“减速带”,争取一个让研究能力赶上来的窗口期。当然,这种思路在现实中有没有效果,还得看各国政府和企业的博弈,也取决于 Anthropic 这类公司自己的安全成果能不能服众。

回看整个访谈,Dario 传递的其实是一种务实的、安全第一的价值观:Anthropic 不追求成为 AGI 竞赛里跑得最快的那一个,而是要成为安全曲线上领先的那一个。这期节目不会给你一堆技术黑话,而是让你理解,在 AI 军备竞赛的喧嚣背后,有一家公司正试图把“怎么让 AI 不变坏”变成一个可以拆解、可以迭代的工程问题。如果你对五年后世界将变成什么样、以及谁来给 AI 拴上缰绳感兴趣,这期视频是一个很好的起点。

更多 · Dario Amodei