用于交互式自动驾驶的生成式智能体行为模型的后训练与测试时缩放
机器人学
2025-12-16 v1 计算机视觉与模式识别
摘要
学习多个智能体之间的交互运动行为是自动驾驶的核心挑战。虽然模仿学习模型能够生成真实轨迹,但它们往往继承自以安全演示为主的数据集的限制,在安全关键场景中鲁棒性不足。此外,大多数研究依赖开环评估,忽视了闭环执行中的误差累积。我们通过两种互补策略解决这些限制。首先,我们提出组相对行为优化(Group Relative Behavior Optimization, GRBO),一种通过组相对优势最大化与人类正则化对预训练行为模型进行微调的强化学习后训练方法。仅使用10%的训练数据,GRBO在保持行为真实性的同时将安全性能提升了超过40%。其次,我们引入Warm-K,一种热启动的Top-K采样策略,用于在运动选择中平衡一致性与多样性。基于Warm-K方法的测试时缩放在不重新训练的情况下增强了行为一致性和反应性,缓解了协变量偏移并减少了性能差异。演示视频见补充材料。
引用
@article{arxiv.2512.13262,
title = {Post-Training and Test-Time Scaling of Generative Agent Behavior Models for Interactive Autonomous Driving},
author = {Hyunki Seong and Jeong-Kyun Lee and Heesoo Myeong and Yongho Shin and Hyun-Mook Cho and Duck Hoon Kim and Pranav Desai and Monu Surana},
journal= {arXiv preprint arXiv:2512.13262},
year = {2025}
}
备注
11 pages, 5 figures