基于贝叶斯优化的逆强化学习中奖励函数的高效探索
机器学习
2020-11-18 v1 人工智能
机器人学
摘要
逆强化学习(IRL)问题关乎多种任务,包括价值对齐与从演示中学习机器人。尽管近年来有显著的算法贡献,IRL核心上仍是一个病态问题;多个奖励函数与观测行为一致,且若无先验知识或补充信息,实际奖励函数不可辨识。本文提出一种称为贝叶斯优化-IRL(BO-IRL)的IRL框架,通过高效探索奖励函数空间来识别与专家演示一致的多个解。BO-IRL利用贝叶斯优化以及我们新提出的核来实现这一点,该核(a)将策略不变奖励函数的参数投影到潜空间中的单点,且(b)确保潜空间中邻近点对应于产生相似似然的奖励函数。该投影允许在潜空间中使用标准平稳核来捕捉奖励函数空间中存在的相关性。在合成与真实环境(无模型与基于模型)上的实证结果表明,BO-IRL在最小化昂贵的精确策略优化次数的同时发现了多个奖励函数。
引用
@article{arxiv.2011.08541,
title = {Efficient Exploration of Reward Functions in Inverse Reinforcement Learning via Bayesian Optimization},
author = {Sreejith Balakrishnan and Quoc Phong Nguyen and Bryan Kian Hsiang Low and Harold Soh},
journal= {arXiv preprint arXiv:2011.08541},
year = {2020}
}
备注
Accepted to 34th Conference on Neural Information Processing Systems (NeurIPS 2020). Includes Appendix. 21 pages