基于逆强化学习与蒙特卡洛树搜索的协同轨迹规划奖励模型学习
机器学习
2022-11-15 v3 机器人学
摘要
自动驾驶车辆的协同轨迹规划方法可解决需要交通参与者间高度协作的交通场景。然而,为使协同系统融入以人为中心的交通,自动驾驶系统必须表现得像人一样,以便人类能预判系统的决策。尽管强化学习在解决决策部分方面取得了显著进展,但参数化一个能产生可预测动作的奖励模型并非易事。本工作采用基于特征的最大熵逆强化学习结合蒙特卡洛树搜索,来学习最大化所记录多智能体协同专家轨迹似然的奖励模型。评估表明,该方法能恢复出合理的、模仿专家且与手动调参基线奖励模型表现相近的奖励模型。
引用
@article{arxiv.2202.06443,
title = {Learning Reward Models for Cooperative Trajectory Planning with Inverse Reinforcement Learning and Monte Carlo Tree Search},
author = {Karl Kurzer and Matthias Bitzer and J. Marius Zöllner},
journal= {arXiv preprint arXiv:2202.06443},
year = {2022}
}