中文

通过解释与上下文感知数据增强拓宽人类引导强化学习中的交互通道

人工智能 2021-10-28 v5

摘要

人类解释(例如就特征重要性而言)近来被用于扩展交互式机器学习中人与智能体之间的沟通渠道。在此设定下,人类训练者不仅提供真值,还提供某种形式的解释。然而,此类人类引导仅在监督学习任务中被研究过,如何最好地将这类人类知识融入深度强化学习仍不清楚。本文首次研究了在人类回路强化学习(HRL)中使用人类视觉解释。我们聚焦于从反馈中学习的任务,其中人类训练者不仅对查询的状态-动作对给出二元评价性“好”或“坏”反馈,还通过标注图像中的相关特征提供视觉解释。我们提出 EXPAND(EXPlanation AugmeNted feeDback,解释增强反馈),通过仅扰动人类显著信息中无关特征的上下文感知数据增强,鼓励模型编码任务相关特征。我们选取五项任务,即 Pixel-Taxi 和四款 Atari 游戏,来评估该方法的性能与样本效率。我们表明,我们的方法显著优于改编自监督学习的利用人类解释的方法,以及仅利用评价性反馈的人类回路 RL 基线。

关键词

引用

@article{arxiv.2006.14804,
  title  = {Widening the Pipeline in Human-Guided Reinforcement Learning with Explanation and Context-Aware Data Augmentation},
  author = {Lin Guan and Mudit Verma and Sihang Guo and Ruohan Zhang and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2006.14804},
  year   = {2021}
}