编码器-解码器模型中的长度偏差及全局条件化的案例
人工智能
2016-09-22 v2 计算与语言
摘要
编码器-解码器网络在许多应用中被广泛用于对序列进行概率建模。与通常假设非相邻变量间条件独立的早期模型(如 CRFs)不同,这些模型利用长短期记忆(LSTM)架构的强大能力来捕捉变量间的完全依赖关系。然而在实践中,编码器-解码器模型表现出对短序列的偏好,令人惊讶的是,这种偏差随着束大小的增加而加剧。在本文中,我们证明这种现象是由于完整序列间隔与编码器-解码器模型的局部条件化训练目标所施加的逐元素间隔之间存在差异所致。这种差异对长序列产生更不利的影响,从而解释了预测短序列的偏差。对于预测序列来自闭集的情况,我们证明全局条件化模型能够缓解编码器-解码器模型的上述问题。从实际角度来看,我们提出的模型还消除了推理过程中对束搜索的需求,使其简化为向量空间中高效的基于点积的搜索。
引用
@article{arxiv.1606.03402,
title = {Length bias in Encoder Decoder Models and a Case for Global Conditioning},
author = {Pavel Sountsov and Sunita Sarawagi},
journal= {arXiv preprint arXiv:1606.03402},
year = {2016}
}