中文

挖掘长尾:面向自主运动规划鲁棒离线强化学习的以数据为中心的关键性度量比较研究

机器人学 2025-09-18 v2 人工智能 机器学习

摘要

离线强化学习(RL)为从大规模真实世界驾驶日志中训练自动驾驶车辆(AV)规划策略提供了一种有前景的范式。然而,这些日志中存在极端的数据不平衡,即平凡场景的数量远超罕见的“长尾”事件,这在使用标准均匀数据采样时会导致脆弱且不安全的策略。在本工作中,我们通过对旨在使学习过程聚焦于信息丰富样本的数据筛选策略进行系统性、大规模比较研究来应对这一挑战。我们研究了六种不同的关键性加权方案,将其分为三类:基于启发式、基于不确定性和基于行为。我们在两个时间尺度上对这些方案进行了评估,即单个时间步和完整场景。我们训练了七个带有最先进注意力架构的目标条件保守 Q 学习(CQL)智能体,并在高保真 Waymax 模拟器中对其进行评估。我们的结果表明,所有数据筛选方法均显著优于基线。值得注意的是,使用模型不确定性作为信号的数据驱动筛选实现了最显著的安全性提升,将碰撞率降低了近三倍(从 16.0% 降至 5.5%)。此外,我们发现了一个明确的权衡:时间步级加权在反应式安全性方面表现优异,而场景级加权则改善了长时程规划。我们的工作为离线 RL 中的数据筛选提供了综合框架,并强调智能的非均匀采样是构建安全可靠自主智能体的关键组成部分。

关键词

引用

@article{arxiv.2508.18397,
  title  = {Mining the Long Tail: A Comparative Study of Data-Centric Criticality Metrics for Robust Offline Reinforcement Learning in Autonomous Motion Planning},
  author = {Antonio Guillen-Perez},
  journal= {arXiv preprint arXiv:2508.18397},
  year   = {2025}
}