确定性日志记录下基于Bandit反馈的反事实学习:统计机器翻译中的案例研究
机器学习
2017-12-15 v3 计算与语言
机器学习
摘要
统计机器翻译(SMT)反事实学习的目标是从记录数据中优化目标SMT系统,这些数据包含用户对另一个历史SMT系统预测的翻译的反馈。一个挑战来自于风险规避的商业SMT系统会确定性地记录最可能的翻译。SMT输出空间缺乏充分探索似乎与反事实学习的理论要求相矛盾。我们表明,通过在学习过程中平滑确定性成分,仍然可以从确定性bandit日志中进行反事实学习。这可以通过加性和乘性控制变量来实现,这些控制变量避免了经验风险最小化中的退化行为。我们的模拟实验表明,通过从确定性bandit反馈中进行反事实学习,BLEU分数最多可提升2点。
引用
@article{arxiv.1707.09118,
title = {Counterfactual Learning from Bandit Feedback under Deterministic Logging: A Case Study in Statistical Machine Translation},
author = {Carolin Lawrence and Artem Sokolov and Stefan Riezler},
journal= {arXiv preprint arXiv:1707.09118},
year = {2017}
}
备注
Conference on Empirical Methods in Natural Language Processing (EMNLP), 2017, Copenhagen, Denmark