用概率奖励与在线推断表达多样化人类驾驶行为
机器人学
2020-08-24 v2 人工智能
摘要
在人机交互(HRI)系统(如自动驾驶车辆)中,理解和表示人类行为十分重要。人类行为天然丰富且多样。成本/奖励学习作为一种学习和表示人类行为的高效方法,已成功应用于许多领域。然而,大多数传统的逆强化学习(IRL)算法不能充分捕捉人类行为的多样性,因为它们假设给定数据集中的所有行为都是由单一成本函数生成的。在本文中,我们提出了一个概率 IRL 框架,直接在连续域中学习成本函数的分布。我们在合成数据和真实人类驾驶数据上进行了评估。定量和主观结果均表明,我们提出的框架能更好地表达多样化的人类驾驶行为,并提取出与用户研究中人类参与者所解读的不同的驾驶风格。
引用
@article{arxiv.2008.08812,
title = {Expressing Diverse Human Driving Behavior with Probabilistic Rewards and Online Inference},
author = {Liting Sun and Zheng Wu and Hengbo Ma and Masayoshi Tomizuka},
journal= {arXiv preprint arXiv:2008.08812},
year = {2020}
}
备注
7 pages, 9 figures, 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)