中文

利用基于EEG的隐式人类反馈加速强化学习智能体

神经与进化计算 2020-10-15 v3 机器学习 信号处理

摘要

为强化学习(RL)智能体提供人类反馈可显著改善学习的多个方面。然而,以往方法需要人类观察者显式地给出输入(例如按键、语音接口),给RL智能体学习过程中的人类带来了负担。此外,有时难以或无法获取显式的人类建议(反馈),例如自动驾驶、残障康复等。本工作中,我们研究通过EEG以错误相关电位(ErrP)的形式捕捉人类的内在反应作为隐式(且自然的)反馈,为人类提供了一种自然且直接的方式来改进RL智能体学习。由此,人类智能可通过隐式反馈与RL算法相融合,从而加速RL智能体的学习。我们开发了三个相当复杂的2D离散导航游戏,以实验评估所提工作的整体性能。我们工作的主要贡献如下:(i)我们提出并实验验证了ErrP的零样本学习,其中ErrP可针对一个游戏学习,并迁移到其他未见过的游戏;(ii)我们提出了一种新颖的RL框架,通过ErrP将隐式人类反馈与RL智能体融合,提升了标签效率并对人类错误具有鲁棒性;(iii)与先前工作相比,我们将ErrP的应用扩展到相当复杂的环境,并通过真实用户实验证明了我们的方法在加速学习方面的重要性。

关键词

引用

@article{arxiv.2006.16498,
  title  = {Accelerating Reinforcement Learning Agent with EEG-based Implicit Human Feedback},
  author = {Duo Xu and Mohit Agarwal and Ekansh Gupta and Faramarz Fekri and Raghupathy Sivakumar},
  journal= {arXiv preprint arXiv:2006.16498},
  year   = {2020}
}