自调节交互式序列到序列学习
计算与语言
2019-11-01 v2 机器学习
摘要
并非所有类型的监督信号都是等同的:不同类型的反馈具有不同的代价以及对学习的不同影响。我们展示了决定何时向教师(或向自身)请求何种反馈的自调节策略如何被表述为一个学会学习问题,从而改进了代价感知的序列到序列学习。在交互式神经机器翻译的实验中,我们发现自调节器通过混合包括修正、错误标注与自监督在内的不同反馈类型,发现了一种用于最优代价-质量权衡的 -贪婪策略。此外,我们证明了其在领域偏移下的鲁棒性,并将其确定为主动学习的一种有前景的替代方案。
引用
@article{arxiv.1907.05190,
title = {Self-Regulated Interactive Sequence-to-Sequence Learning},
author = {Julia Kreutzer and Stefan Riezler},
journal= {arXiv preprint arXiv:1907.05190},
year = {2019}
}
备注
ACL 2019