跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

Andrej Karpathy:大语言模型入门一小时


大型语言模型本质上由参数文件和运行代码两个文件组成,以Llama 2 70B为例,其参数文件存储了700亿个参数。

Andrej Karpathy 是 AI 圈里的标志性人物,先后在特斯拉领导过自动驾驶视觉,又回到 OpenAI 做研究。他做了一个小时的演讲,专给非技术人员讲大语言模型是怎么回事。他一上来就甩出一个极简结论:大语言模型,不过是两个文件——一个存参数,一个跑代码。他用 Meta 开源的 Llama 2 70B 现场解剖,告诉所有人,那些能写诗、聊天、编程的 AI,内部结构就这么简单。

这几年,ChatGPT 这类闭源模型让用户隔着网页或 API 使用,大家总觉得背后有深不可测的魔法。Karpathy 偏要把这层神秘感撕掉。他特意选了 Llama 2,因为它的 700 亿个参数、模型结构、训练配方全都公开,任何人都能下载。他的意思是:别把 AI 当黑箱,它其实是一堆看得见摸得着的数字。

最核心的论据就是参数文件。Llama 2 70B 有 700 亿个参数,每个参数用 16 位浮点数存着,也就是 2 个字节,整个文件 140 GB。别小看这些数字,它们是从几万亿字的文本里,通过海量计算“熬”出来的精华。这些数字密密麻麻连成一张神经网络,里面记载了语法、常识、推理逻辑,甚至写代码的直觉。而你需要的运行代码,短到让人意外——只有 500 行左右的 C 语言程序,没有任何外部依赖。不用装 Python,不用拉 PyTorch 那些大框架,更不用联网。代码做的事很直接:读入你的文字,把它变成向量,让向量在网络的各层间做矩阵乘法、非线性变换,最后给出一个概率分布,告诉你下一个词最可能是什么。采样一下,新词就蹦出来。循环往复,句子、段落、文章就流畅地生成了。你找一台内存够大的电脑,把这 140 GB 文件和 C 代码装进去,拔掉网线,一个能对话的 AI 就在本地跑起来了。这完全是自包含的,像手里攥着一个浓缩了人类语言知识的硬盘。

当然,这套简化叙事也有好几个槽点。首先,推理轻巧,但训练重如泰山。要得到这 140 GB 的参数,得靠数千块 GPU 连跑几周,烧掉几千万元,处理 PB 级的干净文本,这门槛只有巨头才跨得过去。开源只开了成品,没开源生产线的代价。其次,虽然代码只有 500 行,但你的普通笔记本内存根本塞不下 140 GB,没专业显卡或大内存工作站,想都别想。要么你会压缩、量化,牺牲点性能,否则就得砸钱买硬件。再者,开源模型的安全对齐赶不上闭源豪门的投入。OpenAI 花巨资做人类反馈强化学习(RLHF),让模型不乱说话,而 Llama 2 一旦被人微调,就可能沦为造谣、诈骗、或者制造武器的工具,平台很难监控。最后,实际用起来根本不是扔句话进去就出好结果。怎么设计提示词、怎么压住幻觉、怎么纠正偏见,这些脏活累活是那两个文件完全罩不住的,也是行业里最头疼的工程难题。

Karpathy 这堂课最妙的地方,是把一个让人敬畏的庞大系统,还原成一台可以拆开来看的机器。他呼应了 AI 民主化的大潮,让更多人有机会摸到、改到、理解到曾经锁在云端的核心技术。但也正因为他把内核剥得这么干净,我们反而更看清了真正的坎儿:怎么让这两团文件里的数字,输出可靠、负责、对人有益的内容,而不是漂亮的废话。这恐怕是未来很长一段时间,整个行业必须死磕的硬骨头。

更多 · Andrej Karpathy