中文

基于模拟人类反馈的Bandit神经机器翻译强化学习

计算与语言 2017-11-15 v4 人工智能 人机交互 机器学习

摘要

机器翻译是从人类反馈中进行强化学习的天然候选问题:用户提供快速、粗略的候选翻译评分,以引导系统改进。然而,当前的神经机器翻译训练侧重于昂贵的人工生成参考译文。我们描述了一种通过模拟人类反馈改进神经机器翻译系统的强化学习算法。该算法将优势演员-评论家算法(Mnih等,2016)与基于注意力的神经编码器-解码器架构(Luong等,2015)相结合。此算法(a)专为具有大动作空间和延迟奖励的问题而精心设计,(b)有效优化传统语料库级机器翻译指标,且(c)对模仿实际人类行为的偏斜、高方差、细粒度反馈具有鲁棒性。

关键词

引用

@article{arxiv.1707.07402,
  title  = {Reinforcement Learning for Bandit Neural Machine Translation with Simulated Human Feedback},
  author = {Khanh Nguyen and Hal Daumé and Jordan Boyd-Graber},
  journal= {arXiv preprint arXiv:1707.07402},
  year   = {2017}
}

备注

11 pages, 5 figures, In Proceedings of Empirical Methods in Natural Language Processing (EMNLP) 2017