UMBRELLA:利用规划的具有不确定性感知的基于模型离线强化学习
机器人学
2022-06-29 v3 人工智能
机器学习
摘要
离线强化学习(RL)提供了一种从离线数据学习决策制定的框架,因此构成了如自动驾驶等现实世界应用的一种有前景的方法。自动驾驶车辆(SDV)学习一个策略,其甚至可能优于次优数据集中的行为。尤其在如自动驾驶等安全关键应用中,可解释性与可迁移性是成功的关键。这促使了利用规划的基于模型离线RL方法的使用。然而,当前最先进的方法常忽视源于多智能体系统随机行为的偶然不确定性影响。本工作提出一种新颖的具有不确定性感知的基于模型离线强化学习方法并利用规划(UMBRELLA),其以可解释的基于学习的方式联合求解SDV的预测、规划与控制问题。一个训练好的动作条件随机动力学模型清晰捕捉交通场景的不同未来演化。分析提供了我们的方法在挑战性自动驾驶仿真中及基于真实世界公开数据集上有效性的经验证据。
引用
@article{arxiv.2111.11097,
title = {UMBRELLA: Uncertainty-Aware Model-Based Offline Reinforcement Learning Leveraging Planning},
author = {Christopher Diehl and Timo Sievernich and Martin Krüger and Frank Hoffmann and Torsten Bertram},
journal= {arXiv preprint arXiv:2111.11097},
year = {2022}
}
备注
Best Paper Award @ Advances in Neural Information Processing Systems - Machine Learning for Autonomous Driving Workshop (NeurIPS 2021 ML4AD)