跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

黄仁勋:4 万亿美元的 NVIDIA 与 AI 革命(Lex #494)


黄仁勋阐述英伟达从芯片到系统级协同设计的战略动因,即AI工作负载需超线性加速,迫使软硬件全栈整合。

黄仁勋在 Lex Fridman 的播客里,没有大谈 GPU 有多快,而是反复念叨一个概念:协同设计。听起来技术味挺浓,但他的解释很直白:今天 AI 要解决的问题,根本不是一块芯片甚至一台机器能搞定的。你把模型和数据拆成几万份,扔到几万台机器上同时跑,结果发现速度并没有线性增长,甚至一加机器就卡壳。为什么?因为瓶颈不只在计算,更在通信、存储和散热。他打了个比方,如果计算只占整个工作负载的 50%,哪怕你把这部分加速一百万倍,整体撑死也就快两倍。这就是计算机系教过的阿姆达尔定律——系统中最慢的那一截,决定了你的天花板。

而英伟达过去几年做的事,说白了就是要把所有短板都拉长。不是只造更快的 GPU,而是从芯片设计、芯片间的连接协议、网络交换机、服务器机柜、甚至数据中心的冷却方式,全部自己动手。黄仁勋管这叫“极端协同设计”。传统的路子是各干各的:英特尔的 CPU,博通的网卡,标准的以太网,再插上英伟达的显卡。这种搭积木的玩法够通用,但对 AI 训练这种极端任务,每一层中间件的延迟、带宽损耗都在蚕食性能。英伟达选择垂直整合,自己研发 NVLink 来让 GPU 之间高速直连,收购 Mellanox 拿到 InfiniBand 网络技术,连机柜的供电和散热都重新设计。这样就能确保从代码跑到最后一瓦电,全程没有多余的消耗。黄仁勋也承认,干这事儿团队几万人,跨物理、电气、软件十几个学科,协调起来能把人逼疯,但也正好成了英伟达的护城河——对手买齐所有零件也拼不出同样性能的机器。

当然,这种打法不是没有争议。有人会说,你什么都自己搞,成本高得离谱,用户容易被绑在你的生态里出不来。前些年流行的 Chiplet、先进封装这些技术,本来就是为了让不同厂商把自家最强的小芯片拼在一起,不用什么都从头造。行业里鼓吹开放标准的声音一直没断过,比如 CXL 总线、UCIe 互联,想让大家在一个开放规矩下一起玩,避免一家独大。要是所有公司都学英伟达搞闭环,芯片产业的活力可能反而被扼杀。对此,黄仁勋没直接驳斥,但他的逻辑很明确:当你要用一万台机器干出百万倍的加速,还在那指望拼标准件、指望每层都相互谦让,根本就是天方夜谭。那些通用方案也许能省一时之钱,却永远跨不过极限性能的悬崖。英伟达就是靠一次次实际落地,证明了只有打穿所有环节,才能让 AI 的规模暴力扩张下去。

这期聊天帮你把英伟达的战略从“卖显卡的公司”拉到了系统颠覆者的高度。黄仁勋要的早已不是芯片本身的市场份额,而是定义下一代 AI 基础设施的规则。跟他规划的万亿美元蓝图相比,眼下的市值不过是个注脚。如果你还在纠结 DLSS 多生成了几帧画面算不算作弊,那可能真没读懂他在忙什么。

更多 · Jensen Huang