具有资格迹的人在回路策略梯度算法在奖励、策略与优势反馈下的收敛性
机器学习
2021-09-16 v1 人工智能
数据结构与算法
人机交互
摘要
流畅的人-智能体通信对于人在回路强化学习的未来至关重要。智能体必须对其人类训练者提供的反馈做出恰当响应,即便在双方尚未积累大量协作经验之前亦如此。因此,学习智能体能够良好响应人类训练者可能提供的各类反馈方案十分重要。本工作分析了 COnvergent Actor-Critic by Humans (COACH) 算法在三种不同反馈类型——策略反馈、奖励反馈与优势反馈——下的表现。对于这三种反馈类型,我们发现 COACH 可能表现出次优性。我们提出 COACH 的一个变体,即片段式 COACH (E-COACH),并证明其在所有三种反馈类型下均收敛。我们将所提 COACH 变体与另外两种强化学习算法 Q-learning 和 TAMER 进行了比较。
引用
@article{arxiv.2109.07054,
title = {Convergence of a Human-in-the-Loop Policy-Gradient Algorithm With Eligibility Trace Under Reward, Policy, and Advantage Feedback},
author = {Ishaan Shah and David Halpern and Kavosh Asadi and Michael L. Littman},
journal= {arXiv preprint arXiv:2109.07054},
year = {2021}
}
备注
Accepted into ICML 2021 workshops Human-AI Collaboration in Sequential Decision-Making and Human in the Loop Learning