面向自主车运动规划的语言模型在策略蒸馏
机器人学
2026-04-10 v1 人工智能
系统与控制
系统与控制
摘要
大语言模型 (LLM) 最近在将轨迹预测重新表述为语言生成问题方面展现出强大的自主车运动规划潜力。然而,在资源受限的 onboard 系统中部署具备能力的 LLM 仍是一个根本性挑战。本文研究如何有效地将运动规划知识从大型教师 LLM 转移到更小、更可部署的学生模型。我们基于 GPT-Driver 框架,该框架将驾驶场景表示为语言提示,并通过链式思考推理生成航点轨迹,并探讨两种学生训练范式:(i) 在策略蒸馏 (GKD) 中,学生在其自身生成的输出上进行训练,使用教师对每个 token 的密集反馈;(ii) 使用教师的对数概率作为每个 token 的奖励信号的稠密反馈强化学习 (RL) 基线。在 nuScenes 基准测试中实验显示,GKD 在模型规模缩小 5 倍的情况下,显著优于 RL 基线,接近教师水平性能。这些结果凸显了在策略蒸馏方面的实用价值,作为一种原则且有效的方法,可用于在自主驾驶系统中部署基于 LLM 的规划器。
关键词
引用
@article{arxiv.2604.07944,
title = {On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning},
author = {Amirhossein Afsharrad and Amirhesam Abedsoltan and Ahmadreza Moradipari and Sanjay Lall},
journal= {arXiv preprint arXiv:2604.07944},
year = {2026}
}