主动利他学习与信息充分性在自动驾驶中的应用
人工智能
2021-10-12 v1 计算机科学与博弈论
摘要
车辆间的安全交互要求具备选择能揭示其他车辆偏好的动作的能力。由于探索性动作通常并不直接有助于自身目标,交互车辆还必须能够判断何时适宜执行此类动作。本工作中,我们展示了如何利用主动学习 (Active Learning) 方法激励自动驾驶车辆 (AV) 选择能揭示另一车辆利他倾向信息的动作。我们识别出奖励函数应具备的一种性质——信息充分性 (Information Sufficiency),以使探索不至于不必要地干扰目标追求。我们通过实验证明,不具备信息充分性的奖励函数易于导致不充分的探索,从而产生次优行为。我们提出了一种具备信息充分性的奖励定义,并表明它能促使自动驾驶车辆选择探索性动作以估计利他倾向,同时补偿车辆间信念冲突的可能性。
引用
@article{arxiv.2110.04580,
title = {Active Altruism Learning and Information Sufficiency for Autonomous Driving},
author = {Jack Geary and Henry Gouk and Subramanian Ramamoorthy},
journal= {arXiv preprint arXiv:2110.04580},
year = {2021}
}
备注
9 pages, 10 figures