Orion-Lite:将 LLM 推理蒸馏至高效视觉驱动模型
计算机视觉与模式识别
2026-04-10 v1
摘要
利用大语言模型 (LLM) 所具备的广泛世界知识,对提升自动驾驶系统处理稀有和复杂情景的能力具有重大潜力。尽管将 LLM 集成到视觉-语言-动作 (VLA) 模型中已取得领先性能,但其庞大的参数规模在延迟敏感和能源效率部署方面构成严峻挑战。将 LLM 知识蒸馏至紧凑驾驶模型是一个引人注目的解决方案,既能保留这些推理能力,又能保持可管理的计算资源占用。尽管已有工作在相对简单的情景和开放环�评估中证明了蒸馏的有效性,但这些努力主要聚焦于简单情景,缺乏闭环评估。因此,本文探讨了在更复杂、交互式情景下的 LLM 蒸馏,进行闭环评估。我们展示,通过潜在特征蒸馈和真实轨迹监督,一个高效视觉模型学生 \textbf{Orion-Lite} 甚至可以超越其庞大的 VLA 教师 ORION。在严格的 Bench2Drive 基准上实现最新的最佳性能,驾驶得分达 80.6。这一发现表明,视觉模型架构仍具备显著、未被充分挖掘的高性能响应式规划潜力。
关键词
引用
@article{arxiv.2604.08266,
title = {Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models},
author = {Jing Gu and Niccolò Cavagnero and Gijs Dubbelman},
journal= {arXiv preprint arXiv:2604.08266},
year = {2026}
}