AdaThinkDrive:基于强化学习的自适应驱动思考
计算机视觉与模式识别
2025-09-18 v1
摘要
虽然链式思考(Chain of Thought, CoT)等推理技术已在视觉语言动作(Vision Language Action, VLA)模型中广泛应用,但在端到端自动驾驶中展现出前景。然而,近期将 CoT 推理集成到实际场景中常常力求不足,引入不必要的计算开销,却未能提升决策质量。为此,我们提出 AdaThinkDrive,一种受快速思考与慢速思考灵感启发的新型 VLA 框架,具备双模式推理机制。首先,该框架在大规模自动驾驶场景下进行预训练,利用问答(QA)和轨迹数据集获取世界知识和驾驶常识。在监督微调(SFT)过程中,我们引入双模式数据集:快速答复(无 CoT)和慢速思考(带 CoT),使模型能够区分需要推理的场景。进一步,我们提出一种适应性思考奖励策略,结合群相对政策优化(GRPO),对模型选择性地应用 CoT 进行奖励,通过比较不同推理模式下的轨迹质量来实现。大量实验表明,AdaThinkDrive 在 Navsim 基准测试中获得 PDMS 为 90.3,超越最佳视觉基线模型 1.7 分。此外,消融实验显示,AdaThinkDrive 分别优于从不思考和总是思考两个基线模型,分别提升 PDMS 2.0 和 1.4。还显示,与总是思考的基线相比,AdaThinkDrive 推理时间缩短 14%,证明其通过自适应推理在准确率与效率之间取得平衡。
引用
@article{arxiv.2509.13769,
title = {AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving},
author = {Yuechen Luo and Fang Li and Shaoqing Xu and Zhiyi Lai and Lei Yang and Qimao Chen and Ziang Luo and Zixun Xie and Shengyin Jiang and Jiaxin Liu and Long Chen and Bing Wang and Zhi-xin Yang},
journal= {arXiv preprint arXiv:2509.13769},
year = {2025}
}