中文

结合同步人类控制与反馈的 Actor-Critic 强化学习

人工智能 2017-03-16 v2 人机交互 机器人学

摘要

本文对在人机交互过程中不同人类用户如何传递同步控制与反馈信号进行了首次研究。作为这项工作的一部分,我们形式化并提出了一个用于人类与强化学习智能体之间在线合作的通用交互式学习框架。在许多人机交互场景中,复杂半自主系统的自由度与人类控制通道数量之间存在日益扩大的差距。需要简单的人类控制与反馈机制来弥合这一差距,并使人类与机器能够在复杂任务上更好地协作。为了更好地为同步控制与反馈界面的设计提供参考,我们展示了一个人机协作领域的实验结果,其中人类必须同时传递控制与反馈信号,以交互式地训练一个 Actor-Critic 强化学习机器人。我们比较了三种实验条件:1) 人类传递控制信号,2) 奖励塑形反馈信号,以及 3) 同步控制与反馈。我们的结果表明,受试者在同时传递反馈和控制信号时提供的反馈较少,且控制信号质量并未显著降低。我们的数据还表明,受试者也可能改变其提供反馈的时机和方式。通过基于本研究的算法开发与调优,我们期望机器智能体的半自主行为能够更好地由人类反馈所塑造,从而在困难的交互领域实现无缝协作并提升性能。

关键词

引用

@article{arxiv.1703.01274,
  title  = {Actor-Critic Reinforcement Learning with Simultaneous Human Control and Feedback},
  author = {Kory W. Mathewson and Patrick M. Pilarski},
  journal= {arXiv preprint arXiv:1703.01274},
  year   = {2017}
}

备注

10 pages, 2 pages of references, 8 figures. Under review for the 34th International Conference on Machine Learning, Sydney, Australia, 2017. Copyright 2017 by the authors