在闭环中学习真实交通智能体
机器人学
2023-11-03 v1 计算机视觉与模式识别
机器学习
摘要
真实交通仿真对于在真实世界部署前以安全且可扩展的方式开发自动驾驶软件至关重要。通常,模仿学习(IL)用于直接从离线收集的真实世界观测中学习类人交通智能体,但缺乏明确的交通规则规范时,仅由 IL 训练的智能体频繁表现出不真实的违规,如碰撞与驶离道路。该问题在分布外与长尾场景中加剧。另一方面,强化学习(RL)可训练交通智能体避免违规,但单独使用 RL 会导致非类人驾驶行为。我们提出 Reinforcing Traffic Rules(RTR),一种在交通合规约束下匹配专家演示的整体闭环学习目标,自然引出联合 IL + RL 方法,兼得两者之长。我们的方法在真实世界数据集的常规场景与程序生成的长尾场景的闭环仿真中学习。实验表明,RTR 学到更真实且可泛化的交通仿真策略,在常规与长尾场景中实现了类人驾驶与交通合规间显著更优的权衡。此外,当用作训练预测模型的数据生成工具时,相较基线交通智能体,我们学到的交通策略带来明显改进的下游预测指标。更多信息见项目网站:https://waabi.ai/rtr
引用
@article{arxiv.2311.01394,
title = {Learning Realistic Traffic Agents in Closed-loop},
author = {Chris Zhang and James Tu and Lunjun Zhang and Kelvin Wong and Simon Suo and Raquel Urtasun},
journal= {arXiv preprint arXiv:2311.01394},
year = {2023}
}
备注
CORL 2023