基于束搜索连续松弛的循环神经序列模型全局与局部归一化实证研究
机器学习
2019-04-16 v1 计算与语言
机器学习
摘要
全局归一化神经序列模型被认为优于其局部归一化对应模型,因为它们可能改善标签偏置的影响。然而,当考虑以整个输入序列为条件的高容量神经参数化时,两类模型在所能表示的分布上理论等价。因此,在现代神经方法背景下全局归一化的实际优势仍不明确。本文试图通过实证研究阐明该问题。我们扩展了通过束搜索连续松弛(Goyal et al., 2017b)进行搜索感知训练的方法,以通过简单反向传播实现全局归一化循环序列模型的训练。随后我们利用该技术对全局归一化、高容量编码器与搜索感知优化之间的交互进行实证研究。我们观察到,在不精确搜索背景下,全局归一化神经模型仍比其局部归一化对应模型更有效。此外,由于我们的训练方法对使用预训练模型热启动较为敏感,我们还提出了一种基于自归一化的新颖初始化策略用于预训练全局归一化模型。我们在两项任务上对所提方法进行分析:CCG超标注与机器翻译,并展示了在使用搜索感知训练时不同条件下全局归一化的重要性。
引用
@article{arxiv.1904.06834,
title = {An Empirical Investigation of Global and Local Normalization for Recurrent Neural Sequence Models Using a Continuous Relaxation to Beam Search},
author = {Kartik Goyal and Chris Dyer and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:1904.06834},
year = {2019}
}
备注
Long paper at NAACL 2019