中文

用于强化学习的面部反馈:基于 TAMER 框架的案例研究与离线分析

人机交互 2020-01-24 v1 机器学习

摘要

交互式强化学习为智能体提供了一种从人类用户提供的评价性反馈中学习解决任务的方法。先前的研究表明,人类在训练早期会给出大量反馈,但此后反馈非常稀疏。在本文中,我们研究了智能体通过解读训练者的面部表情并将其视为评价性反馈来学习的潜力。为此,我们在强化学习基准问题——无限马里奥(Infinite Mario)中实现了一种流行的交互式强化学习方法 TAMER,并开展了涉及 561 名参与者的首个大规模 TAMER 研究。通过设计的 CNN-RNN 模型,我们的分析表明,告知训练者使用面部表情以及引入竞争机制,可以提高利用面部表情估计正反馈与负反馈的准确率。此外,我们通过模拟实验的结果表明,仅基于面部表情的预测反馈进行学习是可行的,并且使用强效/有效的预测模型或回归方法,面部响应将显著提升智能体的性能。进而,我们的实验支持了先前研究中关于训练界面中双向反馈与竞争性元素重要性的论证。

关键词

引用

@article{arxiv.2001.08703,
  title  = {Facial Feedback for Reinforcement Learning: A Case Study and Offline Analysis Using the TAMER Framework},
  author = {Guangliang Li and Hamdi Dibeklioğlu and Shimon Whiteson and Hayley Hung},
  journal= {arXiv preprint arXiv:2001.08703},
  year   = {2020}
}