将世界分解为对象级知识以解决自动驾驶中的长尾事件
人工智能
2024-07-02 v1 机器人学
摘要
自动驾驶行业越来越多地采用从感知输入到任务输出的端到端学习,以最小化系统设计中的人类偏见。然而,传统的端到端驾驶模型因其训练分布中罕见或未出现的输入而受到长尾事件的制约。为此,我们提出了 TOKEN—a 新型多模态大语言模型(MM-LLM),将世界分解为对象级知识,使其能够更好地利用 LLM 的推理能力,以增强自动驾驶车辆在长尾情景中的规划能力。TOKEN 通过利用传统的端到端驾驶模型产生场景的浓缩且语义丰富的表示,并通过刻意的表示和推理对齐训练阶段优化这些表示以适配 LLM 规划,有效缓解了数据稀缺和效率低下的 tokenization 问题。我们的结果表明,TOKEN 在 grounding、推理和规划方面表现出色,超过了现有框架,使长尾情景下的轨迹 L2 误差降低 27%,碰撞率降低 39%。此外,我们的工作凸显了表示对齐和结构化推理在激发 MM-LLM 通用常识推理能力以实现有效规划方面的重要性。
引用
@article{arxiv.2407.00959,
title = {Tokenize the World into Object-level Knowledge to Address Long-tail Events in Autonomous Driving},
author = {Ran Tian and Boyi Li and Xinshuo Weng and Yuxiao Chen and Edward Schmerling and Yue Wang and Boris Ivanovic and Marco Pavone},
journal= {arXiv preprint arXiv:2407.00959},
year = {2024}
}