中文

序列到序列强化学习中人类赌博机反馈的可靠性与可学习性

计算与语言 2018-12-14 v3 机器学习

摘要

我们针对序列到序列学习中的人类赌博机反馈(bandit feedback)强化学习(RL)展开研究,以赌博机神经机器翻译(NMT)任务为例。我们考察了人类赌博机反馈的可靠性,并分析了可靠性对奖励估计器可学习性的影响,以及奖励估计质量对整体 RL 任务的作用。我们对基数型(5 点评分)与序数型(成对偏好)反馈的分析表明,它们的标注者内与标注者间 α\alpha 一致性程度相当。标准化基数型反馈可获得最佳可靠性,且基数型反馈也最易于从中学习与泛化。最终,通过将基于回归、在 800 条翻译的基数型反馈上训练的奖励估计器整合进 NMT 的 RL 中,可取得超过 1 BLEU 的提升。这表明即便来自少量相当可靠的人类反馈,RL 也是可行的,预示着其在更大规模应用中的巨大潜力。

关键词

引用

@article{arxiv.1805.10627,
  title  = {Reliability and Learnability of Human Bandit Feedback for Sequence-to-Sequence Reinforcement Learning},
  author = {Julia Kreutzer and Joshua Uyheng and Stefan Riezler},
  journal= {arXiv preprint arXiv:1805.10627},
  year   = {2018}
}

备注

ACL 2018