“就像这样给我一个例子”:基于演示的情景式主动强化学习
人工智能
2024-10-04 v3
摘要
强化学习(Reinforcement Learning, RL)在顺序决策问题中取得了很大的成功,但往往需要大量的智能体-环境交互。为了提高样本效率,诸如从专家演示中进行强化学习(Reinforcement Learning from Expert Demonstrations, RLED)等方法通过引入外部专家演示来促进智能体的探索。在实际应用中,这些演示(通常来自人类用户)往往成本高昂,因而受到限制。如何选择对学习最有益的人类演示集合因此成为一个主要关注点。本文提出了EARLY(Episodic Active Learning from demonstration querY),一种使智能体能够生成优化的人类演示查询的算法。基于对智能体当前策略不确定性的轨迹级别估计,EARLY确定特征基础查询的最佳时机和内容。通过查询情景式演示而非孤立的状态-动作对,EARLY改进了人类教学体验并实现了更好的学习性能。我们在三个难度逐渐增加的模拟导航任务中验证了该方法的有效性。结果表明,该方法在由模拟权威策略生成的演示情况下,能够比其他基线方法快超过30%的收敛速度实现专家水平性能。随后进行的一次小规模用户研究(N=18)进一步表明,该方法在人类专家演示者的情况下仍能保持显著更好的收敛速度,同时在感知任务负荷和消耗人类时间方面获得更好的用户体验。
引用
@article{arxiv.2406.03069,
title = {"Give Me an Example Like This": Episodic Active Reinforcement Learning from Demonstrations},
author = {Muhan Hou and Koen Hindriks and A. E. Eiben and Kim Baraka},
journal= {arXiv preprint arXiv:2406.03069},
year = {2024}
}