中文

用于序列预测的任务损失估计

机器学习 2016-01-20 v4

摘要

通常,监督机器学习任务的性能是通过一个无法直接优化的任务损失(task loss)函数评估的。此类损失函数的例子包括分类错误、编辑距离和BLEU分数。针对此问题的一个常见变通方法是转而优化代理损失(surrogate loss)函数,例如交叉熵或铰链损失。为了使该补救方法有效,重要的是确保代理损失的最小化导致任务损失的最小化,我们将此条件称为与任务损失的一致性(consistency with the task loss)。在这项工作中,我们提出另一种推导可微分代理损失的方法,可证明满足该要求。我们关注为每对输入输出定义分数的广泛模型类别。我们的想法是,该分数可解释为任务损失的估计,且估计误差可用作一致的代理损失。这种方法的一个显著特征是它为每对输入输出定义了分数的期望值。我们利用此性质为常用于序列预测任务的编码器-解码器(Encoder-Decoder)模型设计专门的代理损失。在我们的实验中,我们在语音识别任务上进行了基准测试。在不用额外语料库进行语言建模的情况下,使用新的代理损失替代交叉熵训练编码器-解码器语音识别器,在字符错误率(CER)方面带来了显著的~13%相对提升。

关键词

引用

@article{arxiv.1511.06456,
  title  = {Task Loss Estimation for Sequence Prediction},
  author = {Dzmitry Bahdanau and Dmitriy Serdyuk and Philémon Brakel and Nan Rosemary Ke and Jan Chorowski and Aaron Courville and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1511.06456},
  year   = {2016}
}

备注

Submitted to ICLR 2016