基于闭环个性化课程表的持续驾驶策略优化
机器学习
2024-08-14 v4 人工智能
机器人学
摘要
自动驾驶车辆(AV)的安全性一直是长期的首要关切,其根源在于长尾自然驾驶分布中缺乏罕见且安全关键的场景。为应对这一挑战,基于场景的自动驾驶研究大量涌现,聚焦于生成高风险驾驶场景并将其用于 AV 模型的安全关键测试。然而,如何利用这些大量场景进行复用以迭代改进 AV 模型的研究有限。此外,从具有不同行为的其他 AV 模型收集的庞大场景库中筛选、试图提取可迁移信息以改进当前 AV,仍然棘手且困难。因此,我们开发了一个具备闭环个性化课程表(CLIC)的持续驾驶策略优化框架,将其分解为一组标准化子模块以灵活实现:AV 评估、场景选择、AV 训练。CLIC 将 AV 评估构建为碰撞预测任务,估计每次迭代中 AV 在这些场景里失败的概率。随后,基于这些失败概率从历史场景重新采样,CLIC 为下游训练定制个性化课程表,使其与所评估的 AV 能力相对齐。据此,CLIC 不仅最大化了庞大预收集场景库在闭环驾驶策略优化中的利用,也通过以更具挑战性的案例对训练进行个性化,从这些组织不良的场景中促进 AV 改进。实验结果明确表明,CLIC 超越其他基于课程表的训练策略,在应对高风险场景方面显示出实质性改进,同时保持处理简单案例的能力。
引用
@article{arxiv.2309.14209,
title = {Continual Driving Policy Optimization with Closed-Loop Individualized Curricula},
author = {Haoyi Niu and Yizhou Xu and Xingjian Jiang and Jianming Hu},
journal= {arXiv preprint arXiv:2309.14209},
year = {2024}
}
备注
ICRA 2024