用于神经序列模型端到端训练的束搜索连续松弛
机器学习
2017-10-10 v2 计算与语言
神经与进化计算
摘要
束搜索是神经序列模型测试时解码算法的理想选择,因为它有可能避免更简单的贪心方法所产生的搜索错误。然而,这些模型的典型交叉熵训练过程并未直接考虑最终解码方法的行为。因此,对于交叉熵训练的模型,与贪心解码相比,束解码有时会导致测试性能下降。为了训练能够更有效利用束搜索的模型,我们提出了一种新的训练过程,该过程侧重于在束搜索输出上评估的最终损失指标(如 Hamming loss)。尽管定义明确,但这个“直接损失”目标本身是不连续的,因此难以优化。因此,在我们的方法中,通过引入对束搜索解码过程的一种新颖连续近似,我们构建了一个次可微的代理目标。在实验中,我们表明,与交叉熵训练的贪心解码和交叉熵训练的束解码基线相比,优化这一新的训练目标在两个序列任务(命名实体识别和 CCG 超标记)上产生了显著更好的结果。
引用
@article{arxiv.1708.00111,
title = {A Continuous Relaxation of Beam Search for End-to-end Training of Neural Sequence Models},
author = {Kartik Goyal and Graham Neubig and Chris Dyer and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:1708.00111},
year = {2017}
}
备注
Updated for clarity and notational consistency