用于非自回归生成的自适应多层感知机
计算与语言
2023-10-17 v1
摘要
自回归(AR)生成因其有效性几乎主导了序列生成。近来,非自回归(NAR)生成因效率与日增的有效性而愈发流行。然而其效率仍受序列长度二次复杂度的瓶颈制约,对扩展至长序列生成 prohibitive,且鲜有工作缓解该问题。本文提出一种新颖MLP变体——自适应多层感知机(AMLP),以构建具线性时间与空间复杂度的生成模型。不同于具静态可学习投影矩阵的传统MLP,AMLP利用以注意力模式从输入计算的自适应投影。这种样本感知的自适应投影实现了序列中词元间通信,并建模了查询与键空间间的度量。此外,我们将AMLP与流行NAR模型结合,推导出具线性时空复杂度的高效NAR–AMLP架构。实证结果显示,该结合架构在语音合成与机器翻译上以显著优势超越具竞争力的高效NAR模型。我们还通过大量消融实验分别测试AMLP的自注意力与交叉注意力能力,发现其与其它高效模型相当甚至更优。效率分析进一步表明,对于长序列,AMLP相较原始非自回归模型极大降低了内存开销。
引用
@article{arxiv.2310.09512,
title = {Attentive Multi-Layer Perceptron for Non-autoregressive Generation},
author = {Shuyang Jiang and Jun Zhang and Jiangtao Feng and Lin Zheng and Lingpeng Kong},
journal= {arXiv preprint arXiv:2310.09512},
year = {2023}
}
备注
Accepted as a conference paper at research track in 2023 ECML-PKDD