用于比较强化学习智能体偏好的对比解释
人工智能
2021-12-20 v1
摘要
在奖励函数不直观且由一组目标构成的复杂任务中,可通过调整各目标对奖励函数的影响,训练出多个能充分完成任务但采用不同策略的强化学习(RL)策略。理解策略间差异对于使用户能在所提供的策略中做出选择是必要的,并可帮助开发者理解 RL 系统中不同奖励函数与训练超参数所涌现出的不同行为。本工作中,我们比较在同一任务上训练但具有不同目标偏好的两个策略的行为。我们提出一种方法,用以区分源于能力差异的行为差异与源于两个 RL 智能体对立偏好的行为差异。此外,我们仅利用基于偏好的差异数据来生成关于智能体偏好的对比解释。最后,我们在自动驾驶任务上测试并评估了我们的方法,比较了一个安全导向策略与一个偏好速度策略的行为。
引用
@article{arxiv.2112.09462,
title = {Contrastive Explanations for Comparing Preferences of Reinforcement Learning Agents},
author = {Jasmina Gajcin and Rahul Nair and Tejaswini Pedapati and Radu Marinescu and Elizabeth Daly and Ivana Dusparic},
journal= {arXiv preprint arXiv:2112.09462},
year = {2021}
}
备注
7 pages, 3 figures