跳到主内容
建议在桌面浏览器访问以获得最佳体验
主题
← 返回 首页

[CVPR'23 WAD] Keynote - Jiyang Gao, Momenta


Momenta提出数据驱动飞轮策略,通过量产车收集数据并自动化闭环工具链,解决自动驾驶百万级长尾问题,实现可扩展的L4级全自动驾驶。

在2023年的CVPR自动驾驶研讨会上,Momenta的发言人GL站上讲台,向全球计算机视觉与自动驾驶社区传递了一个清晰的信号:要实现真正的全自动驾驶,依靠传统手段已无路可走,唯有拥抱数据驱动的飞轮,并让算法从海量的量产车数据中自我迭代。Momenta自成立之初,就将目标锁定在可扩展的L4级无人驾驶,即让路上每一辆车都具备全时全地的自动驾驶能力。而这个目标有一个硬性门槛:系统必须比人类驾驶员安全至少十倍以上。

背后的原因在于,真实道路环境存在着无穷无尽的长尾场景——那些稀罕、诡异但又决定安全的边缘案例。GL给出的估算是:要彻底解决这些长尾问题,可能需要累计上千亿公里的驾驶数据,而仅靠几百甚至上千辆测试车连零头都难以收集。由此,Momenta提出了两个核心洞察:第一,用基于规则的系统去打补丁,如同用人力去填海,几百个人可以解决几百个问题,却无法用几百万人去解决几百万个问题,数据驱动是唯一出路;第二,只有通过将软件部署到数以百万计的量产车上,并从中智能地采集数据,才能积累起足以攻克长尾的数据规模。

基于这两个洞察,Momenta构建起一套“数据驱动飞轮”,它由三大支柱支撑:一是数据驱动的自动驾驶软件,从感知到规划全面用机器学习替代手写规则;二是来自多家车企合作量产车的海量数据采集管道;三是闭环自动化工具链,负责对采集到的数据进行智能筛选、清洗、标注、训练和验证,让算法迭代可以像工厂流水线一样自动运转。据GL透露,他们目前已积累了150 PB的历史数据,算法迭代正是倚靠这套工具链与量产车数据的持续供给。

在技术分享的核心部分,GL重点介绍了Momenta的无图(mapless)方案。传统自动驾驶高度依赖高精地图(HD map),但高精地图成本高昂、更新缓慢,且难以覆盖所有道路,严重制约了系统扩展。Momenta则几乎完全抛弃了高精地图,仅使用标准清晰度的导航地图(SD map)作为粗略先验。其系统架构由三大模块构成:感知、定位和规划。感知部分接收SD地图、多摄像头图像(激光雷达和雷达是可选项),输出“局部地图”——也就是车辆周围的动态物体和静态路标。其中,一个名为DDLD(数据驱动地标检测)的算法负责从视觉信号中检测车道线、路沿、交通标志等元素,实时构建鸟瞰视角的环境表征。定位模块融合IMU、轮速计和GNSS信号,并可能引入RTK校正,但与传统卡尔曼滤波不同,Momenta采用了名为DDPF(数据驱动姿态融合)的机器学习方法,直接输出车身坐标系下的准确位姿,同时获取一个粗略的全局位姿来对齐SD地图中的行驶路线。而后,局部地图、位姿信息与导航路线一并送入规划器,由它做出驾驶决策并生成轨迹。

这套架构最受争议的或许是其对“完全无图”的妥协:它仍然需要一个不那么精确的SD地图和粗略的全局定位,来为规划提供道路级别的连通信息。部分业内人士可能质疑,在复杂场景下,仅靠即时感知构建的局部地图是否足够可靠。此外,数据驱动飞轮看似高效,却也对数据的质量和多样性提出了极高要求,算法可能因为量产车采集数据偏向简单场景而出现能力天花板。但GL的分享表明,Momenta正试图通过大规模量产车闭环,将感知、定位乃至规划的决定权彻底交给数据,从而避开基于规则的脆弱性和高精地图的成本陷阱。

总体来看,Momenta在CVPR上的这次亮相,既是自动驾驶技术路线的宣言,也是一场工程哲学的展示:放弃对单个算法的过度雕琢,转而去建设一个能让算法自我进化的数据生态系统。这条路能否最终抵达L4无人驾驶的彼岸,仍需时间与里程的检验,但其背后的逻辑——用百万辆车去遇见百万个长尾,再用自动化工具链将其转化为百万次模型迭代——无疑为行业提供了一套说服力十足的解题框架。

更多 · 高继扬