AMOM:面向条件掩码语言模型的分层自适应掩码
计算与语言
2023-03-15 v1 人工智能
摘要
基于 Transformer 的自回归(AR)方法在多种序列到序列生成任务(如神经机器翻译、摘要和代码生成)上取得了引人注目的性能,但推理效率低下。为加速推理阶段,过去几年提出了许多非自回归(NAR)策略。其中,条件掩码语言模型(CMLM)是最通用的框架之一,因其可支持多种不同序列生成场景并在这些任务上取得极具竞争力的性能。本文中,我们进一步引入一种简单而有效的掩码之上的自适应掩码策略,以增强解码器的精炼能力并简化编码器优化。在总计 \textbf{15} 个数据集的 \textbf{3} 种不同任务(神经机器翻译、摘要和代码生成)上的实验证实,我们所提简单方法相较强大的 CMLM 模型实现了显著性能提升。令人惊讶的是,我们所提模型在神经机器翻译上取得了最先进性能(WMT16 ENRO 上 \textbf{34.62} BLEU,WMT16 ROEN 上 \textbf{34.82} BLEU,IWSLT DeEn 上 \textbf{34.84} BLEU),甚至在 \textbf{7} 个基准数据集上以至少 \textbf{2.2} 加速取得优于 \textbf{AR} Transformer 的性能。我们的代码已在 GitHub 上发布。
引用
@article{arxiv.2303.07457,
title = {AMOM: Adaptive Masking over Masking for Conditional Masked Language Model},
author = {Yisheng Xiao and Ruiyang Xu and Lijun Wu and Juntao Li and Tao Qin and Yan-Tie Liu and Min Zhang},
journal= {arXiv preprint arXiv:2303.07457},
year = {2023}
}
备注
Accepted by AAAI2023