中文

ThinkDrive:面向自动驾驶的思维链引导渐进式强化学习微调

人工智能 2026-01-09 v1

摘要

随着大语言模型(LLM)技术的快速发展,其在自动驾驶领域的应用日益广泛。然而,现有方法存在推理非结构化、泛化能力差以及与人类驾驶意图不对齐等问题。虽然思维链(CoT)推理提高了决策透明度,但传统的监督微调(SFT)未能充分发挥其潜力,且强化学习(RL)方法面临不稳定和推理深度欠佳的问题。我们提出了 ThinkDrive,一个用于自动驾驶的 CoT 引导渐进式 RL 微调框架,将显式推理与难度感知的自适应策略优化相结合。我们的方法采用两阶段训练策略。首先,使用 CoT 解释进行 SFT。然后,应用带有难度感知自适应策略优化器的渐进式 RL,该优化器根据样本复杂度动态调整学习强度。我们在公开数据集上评估了该方法。结果表明,ThinkDrive 在 exam、easy-exam 和 accuracy 上分别比强 RL 基线高出 1.45%、1.95% 和 1.01%。此外,使用我们方法训练的 2B 参数模型在 exam 指标上超越了规模大得多的 GPT-4o 3.28%。

关键词

引用

@article{arxiv.2601.04714,
  title  = {ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving},
  author = {Chang Zhao and Zheming Yang and Yunqing Hu and Qi Guo and Zijian Wang and Pengcheng Li and Wen Ji},
  journal= {arXiv preprint arXiv:2601.04714},
  year   = {2026}
}