面向自主赛车的上下文感知模型基强化学习
机器学习
2025-10-14 v1 机器人学
摘要
自主车辆已展现出提升道路用户安全性的巨大潜力。对于这些车辆以及许多其他安全关键型机器人技术而言,都需要能够对未见情景和数据进行良好泛化的算法。在多样化领域中,模型基强化学习算法(MBRL)已展现出领先性能和数据效率。然而,这些算法也表现出对环境及其转换动力学变化的敏感性。本文我们探讨了 MBRL 在自主驾驶中的性能和泛化能力,具体聚焦于模拟自主赛车环境 Roboracer(此前为 F1Tenth)中的头部对决赛车任务。我们将头部对决赛车任务作为学习问题,使用情境马尔可夫决策过程(contextual MDP)进行建模,通过情境对 episode 进行参数化,从而也对转换和奖励动力学进行参数化。我们对该环境中的 MBRL 算法进行基准测试,并提出一种新的情境感知 MBRL 扩展方法 cMask。我们展示,情境感知 MBRL 算法相对于情境无关方法在面对 out-of-distribution 对手行为时具有更好的泛化能力。我们也展示,cMask 在赛车对手拥有 in-distribution 行为时显示出强大的泛化能力,以及相对于其他情境感知 MBRL 方法的进一步性能提升。
引用
@article{arxiv.2510.11501,
title = {Context-Aware Model-Based Reinforcement Learning for Autonomous Racing},
author = {Emran Yasser Moustafa and Ivana Dusparic},
journal= {arXiv preprint arXiv:2510.11501},
year = {2025}
}
备注
Accepted to IEEE ICAR 2025