中文

论序列到序列模型中编码器输出的稀疏化

计算与语言 2020-04-27 v1

摘要

序列到序列模型通常将所有编码器输出传递给解码器以进行生成。相比之下,本文假设这些编码器输出可被压缩以缩短送交解码的序列。我们以 Transformer 为试验平台,在编码器与解码器之间引入一层随机门。该门使用稀疏诱导 L0 惩罚的期望值进行正则化,从而完全屏蔽掉一部分编码器输出。换言之,通过联合训练,L0DROP 层迫使 Transformer 仅通过其编码器状态的子集来路由信息。我们考察了这种稀疏化在两项机器翻译和两项摘要任务上的影响。实验表明,依任务不同,约 40–70% 的源编码可在不显著损害质量的前提下被剪枝。输出长度的减少赋予 L0DROP 提升解码效率的潜力,其在文档摘要任务上相较标准 Transformer 实现了最高 1.65 倍的加速。我们分析了 L0DROP 的行为,观察到其对剪枝特定词类表现出系统性偏好,例如功能词和标点被剪枝得最多。受这些观察启发,我们探讨了基于词性标签、词频和词位置等信息指定规则模式以屏蔽编码器输出的可行性。

关键词

引用

@article{arxiv.2004.11854,
  title  = {On Sparsifying Encoder Outputs in Sequence-to-Sequence Models},
  author = {Biao Zhang and Ivan Titov and Rico Sennrich},
  journal= {arXiv preprint arXiv:2004.11854},
  year   = {2020}
}