中文

对话中隐式人类偏好的离策略批量深度强化学习

机器学习 2019-07-09 v2 人工智能 机器学习

摘要

大多数深度强化学习(RL)系统无法从离策略数据中有效学习,尤其是当它们无法在环境中进行在线探索时。这些是将RL应用于现实世界问题的关键缺陷,因为在这些问题中收集数据成本高昂,且模型在部署以与环境交互之前必须经过离线测试——例如从人类交互中学习的系统。因此,我们开发了一类新颖的离策略批量RL算法,能够在无需探索的情况下,从固定批次的人类交互数据集中有效进行离线学习。我们利用在数据上预训练的模型作为强先验,并在RL训练期间使用KL控制来惩罚与该先验的偏离。我们还使用基于dropout的不确定性估计来下界化目标Q值,作为Double Q-Learning的更高效替代方案。这些算法在开放域对话生成问题上进行了测试——这是一个具有20,000维动作空间的极具挑战性的强化学习问题。使用我们的Way Off-Policy算法,我们可以从收集到的人类交互数据中事后提取多个不同的奖励函数,并从所有这些函数中有效学习。我们通过将这些系统实时部署到开放域环境中与人类对话来测试其现实世界泛化能力,并证明我们的算法在离策略批量RL中相比先前方法取得了显著改进。

关键词

引用

@article{arxiv.1907.00456,
  title  = {Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog},
  author = {Natasha Jaques and Asma Ghandeharioun and Judy Hanwen Shen and Craig Ferguson and Agata Lapedriza and Noah Jones and Shixiang Gu and Rosalind Picard},
  journal= {arXiv preprint arXiv:1907.00456},
  year   = {2019}
}