基于贝叶斯逆强化学习的演示充分性自主评估
机器学习
2024-01-03 v3
摘要
我们研究演示充分性的判定问题:机器人如何自我评估其是否已从专家处获得足够多的演示,以确保达到期望的性能水平?为解决这一问题,我们提出了一种基于贝叶斯逆强化学习和风险价值的新型自我评估方法,使基于演示学习(Learning-from-Demonstration, LfD)的机器人能够计算出其性能的高置信度界,并利用这些界来确定何时已获得足够数量的演示。我们提出并评估了充分性的两种定义:(1) 归一化期望值差异,衡量相对于人类未观测奖励函数的遗憾;(2) 相对于基线策略的百分比改进。我们展示了如何为这两个指标制定高置信度界。我们在离散和连续状态空间域的仿真中评估了该方法,并说明了开发一个能准确评估演示充分性的机器人系统的可行性。我们还表明,机器人可以利用主动学习来请求特定状态下的演示,从而在仍保持对其策略高置信度的同时减少所需演示数量。最后,通过一项用户研究,我们证明该方法成功使机器人能够达到用户期望的性能水平,而无需过多或完美最优的演示。
引用
@article{arxiv.2211.15542,
title = {Autonomous Assessment of Demonstration Sufficiency via Bayesian Inverse Reinforcement Learning},
author = {Tu Trinh and Haoyu Chen and Daniel S. Brown},
journal= {arXiv preprint arXiv:2211.15542},
year = {2024}
}
备注
Prior version appears in proceedings of AAAI FSS-22 Symposium "Lessons Learned for Autonomous Assessment of Machine Abilities (LLAAMA)". Current version appears in proceedings of HRI '24, March 11-14, 2024, Boulder, CO, USA