NORD:无需推理的数据高效视觉-语言-动作模型
人工智能
2026-02-27 v2 计算机视觉与模式识别
摘要
视觉-语言-动作 (VLA) 模型正在通过取代模块化管线,采用统一的端到端架构来推进自动驾驶。然而,现有 VLA 模型面临两个高成本要求:(1) 大规模数据集收集,(2) 密集推理标注。本文针对这两个挑战提出了 NORD (No Reasoning for Driving)。与现有 VLA 模型相比,NORD 在使用不到常规数据集 60% 的数据且无需推理标注的情况下,即可达到竞争性能,token 使用量减少 3 倍。我们指出,标准的 Group Relative Policy Optimization (GRPO) 当应用于此类小规模、无推理数据集训练的策略时,难以获得显著性改进。这一局限性源于难度偏差问题,即 GRPO 对产生高方差 rollout 场景的奖励信号不成比例地施加惩罚。NORD 通过引入 Dr. GRPO,一种旨在缓解 LLM 中难度偏差的最新算法,来克服这一问题。因此,NORD 在更少的数据和无推理开销的情况下,在 Waymo 和 NAVSIM 上实现了竞争性能,为更高效的自动驾驶系统提供了可能。网站:https://nord-vla-ai.github.io/
引用
@article{arxiv.2602.21172,
title = {NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning},
author = {Ishaan Rawal and Shubh Gupta and Yihan Hu and Wei Zhan},
journal= {arXiv preprint arXiv:2602.21172},
year = {2026}
}
备注
Accepted to CVPR 2026