通过对比学习优化非自回归 Transformer
计算与语言
2023-06-05 v2
摘要
非自回归 Transformer(NAT)通过一次性预测所有词而非按序预测,降低了自回归 Transformer(AT)的推理延迟。它们在机器翻译及许多其他应用中取得了显著进展。然而,NAT 长期面临的挑战是学习多模态数据分布,这是 NAT 与 AT 之间性能差距的主要原因。在本文中,我们提出通过从模型分布而非数据分布中采样来缓解模态学习的困难。我们推导对比约束以稳定训练过程,并将该目标与最先进的非自回归架构 DA-Transformer 相整合。我们的模型 \method 在 3 项不同任务上进行了检验,包括机器翻译、文本摘要和复述,共 5 个基准。结果表明,我们的方法以显著优势超越先前的非自回归基线,并在所有基准上为非自回归 Transformer 确立了新的最先进结果。
引用
@article{arxiv.2305.13667,
title = {Optimizing Non-Autoregressive Transformers with Contrastive Learning},
author = {Chenxin An and Jiangtao Feng and Fei Huang and Xipeng Qiu and Lingpeng Kong},
journal= {arXiv preprint arXiv:2305.13667},
year = {2023}
}