中文

CRAFT:面向驾驶策略的反事实到交互式强化微调

机器学习 2026-05-07 v1 机器人学

摘要

开环模仿学习推进了现代自动驾驶策略架构的发展,但闭环部署仍然容易受到策略引发的分布偏移的影响。现有的 post-training 范式表现出根本性的权衡:闭环强化学习微调提供了来自已执行动作的接地反馈,但受到信息事件稀疏性的限制;而反事实微调为候选未来提供了密集的监督,却继承了来自不完美未来估计的偏差。我们引入了反事实到交互式强化微调(CRAFT),这是一个将闭环 post-training 形式化为代理残差优化的 on-policy 框架。CRAFT 使用组归一化的反事实优势作为真实闭环优势的密集代理,并通过来自交互关键事件的接地残差校正,使该代理与闭环世界对齐。为了稳定适应过程,CRAFT 通过非对称 KL 自蒸馏将在线策略正则化至 EMA 教师。在理论上,CRAFT 在相同的访问状态分布下将真实的闭环策略梯度分解为代理项和残差项,通过对齐的代理减少残差方差,同时通过接地的残差近似缓解代理偏差。在实验中,CRAFT 在 Bench2Drive 上跨分层规划、视觉-语言-动作和词汇评分架构实现了最强的闭环收益。消融实验、缩放行为、稳定性分析和迁移结果进一步验证了密集反事实代理与接地残差校正的互补作用。项目页面:https://currychen77.github.io/CRAFT。

关键词

引用

@article{arxiv.2605.04470,
  title  = {CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies},
  author = {Keyu Chen and Nanfei Ye and Yida Wang and Wenchao Sun and Danqi Zhao and Hao Cheng and Sifa Zheng},
  journal= {arXiv preprint arXiv:2605.04470},
  year   = {2026}
}