中文

用于神经序列模型端到端训练的束搜索连续松弛

机器学习 2017-10-10 v2 计算与语言 神经与进化计算

摘要

束搜索是神经序列模型测试时解码算法的理想选择,因为它有可能避免更简单的贪心方法所产生的搜索错误。然而,这些模型的典型交叉熵训练过程并未直接考虑最终解码方法的行为。因此,对于交叉熵训练的模型,与贪心解码相比,束解码有时会导致测试性能下降。为了训练能够更有效利用束搜索的模型,我们提出了一种新的训练过程,该过程侧重于在束搜索输出上评估的最终损失指标(如 Hamming loss)。尽管定义明确,但这个“直接损失”目标本身是不连续的,因此难以优化。因此,在我们的方法中,通过引入对束搜索解码过程的一种新颖连续近似,我们构建了一个次可微的代理目标。在实验中,我们表明,与交叉熵训练的贪心解码和交叉熵训练的束解码基线相比,优化这一新的训练目标在两个序列任务(命名实体识别和 CCG 超标记)上产生了显著更好的结果。

关键词

引用

@article{arxiv.1708.00111,
  title  = {A Continuous Relaxation of Beam Search for End-to-end Training of Neural Sequence Models},
  author = {Kartik Goyal and Graham Neubig and Chris Dyer and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:1708.00111},
  year   = {2017}
}

备注

Updated for clarity and notational consistency