中文

关于非自回归 Transformer 的学习

计算与语言 2022-06-14 v1

摘要

非自回归 Transformer(NAT)是一类文本生成模型,旨在通过并行预测整个句子来降低解码延迟。然而,这种延迟的降低牺牲了捕获从左到右依赖关系的能力,从而使得 NAT 学习极具挑战性。在本文中,我们给出理论与实证分析以揭示 NAT 学习的挑战,并提出一个统一视角来理解已有的成功方法。首先,我们表明简单地通过最大化似然来训练 NAT 会导致对边缘分布的近似,但丢弃了所有词元之间的依赖关系,其中被丢弃的信息可由数据集的条件总相关来度量。其次,我们将许多先前的目标形式化到一个统一框架中,并表明它们的成功可归结为在代理分布上最大化似然,从而减少了信息损失。实证研究表明,我们的视角能够解释 NAT 学习中的现象并指导新训练方法的设计。

关键词

引用

@article{arxiv.2206.05975,
  title  = {On the Learning of Non-Autoregressive Transformers},
  author = {Fei Huang and Tianhua Tao and Hao Zhou and Lei Li and Minlie Huang},
  journal= {arXiv preprint arXiv:2206.05975},
  year   = {2022}
}

备注

accepted at ICML2022