DQN-TAMER:具有难处理反馈的人在环强化学习
人机交互
2018-10-30 v1 机器学习
摘要
探索一直是强化学习(RL)中最大的挑战之一,也是 RL 应用于机器人学的一大障碍。即便采用最先进的 RL 算法,构建一个训练良好的智能体通常也需要过多试验,主要源于难以将其动作与遥远未来的奖励相匹配。一种补救方法是从人类观察者处训练智能体,观察者立即对某些动作给予奖励作为实时反馈。本研究着手解决引入此类人在环 RL 方案的一系列挑战。本工作的首要贡献在于我们对精确建模的人类观察者进行的实验:二值性、延迟、随机性、不可持续性以及自然反应。我们还提出一种称为 DQN-TAMER 的 RL 方法,其高效利用了人类反馈与遥远奖励。我们发现 DQN-TAMER 智能体在 Maze 与 Taxi 模拟环境中优于其基线。此外,我们展示了一个真实世界的人在环 RL 应用,其中摄像头自动识别用户面部表情作为对智能体的反馈,同时智能体探索迷宫。
引用
@article{arxiv.1810.11748,
title = {DQN-TAMER: Human-in-the-Loop Reinforcement Learning with Intractable Feedback},
author = {Riku Arakawa and Sosuke Kobayashi and Yuya Unno and Yuta Tsuboi and Shin-ichi Maeda},
journal= {arXiv preprint arXiv:1810.11748},
year = {2018}
}