中文

自调节交互式序列到序列学习

计算与语言 2019-11-01 v2 机器学习

摘要

并非所有类型的监督信号都是等同的:不同类型的反馈具有不同的代价以及对学习的不同影响。我们展示了决定何时向教师(或向自身)请求何种反馈的自调节策略如何被表述为一个学会学习问题,从而改进了代价感知的序列到序列学习。在交互式神经机器翻译的实验中,我们发现自调节器通过混合包括修正、错误标注与自监督在内的不同反馈类型,发现了一种用于最优代价-质量权衡的 ϵ\epsilon-贪婪策略。此外,我们证明了其在领域偏移下的鲁棒性,并将其确定为主动学习的一种有前景的替代方案。

关键词

引用

@article{arxiv.1907.05190,
  title  = {Self-Regulated Interactive Sequence-to-Sequence Learning},
  author = {Julia Kreutzer and Stefan Riezler},
  journal= {arXiv preprint arXiv:1907.05190},
  year   = {2019}
}

备注

ACL 2019