用于主动逆强化学习的多类广义二分搜索
机器学习
2013-01-24 v1 人工智能
机器学习
摘要
本文探讨从示范中学习任务的问题。我们采用逆强化学习框架,其中任务以奖励函数的形式表示。我们的贡献是一种新颖的主动学习算法,使学习智能体能够向专家查询更具信息量的示范,从而实现更高样本效率的学习。对于这一新颖算法(用于逆强化学习的广义二分搜索,或 GBS-IRL),我们提供了样本复杂度的理论界限,并在几个不同任务上展示了其适用性。据我们所知,GBS-IRL 是第一个具有可证明样本复杂度界限的主动 IRL 算法。我们还结合文献中的其他现有方法讨论了我们的方法,及其在多类分类问题中的普遍适用性。最后,受机器人从示范中学习的近期工作启发,我们还讨论了如何以透明的方式将不同形式的人类反馈整合到我们的学习框架中。
引用
@article{arxiv.1301.5488,
title = {Multi-class Generalized Binary Search for Active Inverse Reinforcement Learning},
author = {Francisco Melo and Manuel Lopes},
journal= {arXiv preprint arXiv:1301.5488},
year = {2013}
}