高效文本摘要的离散扩散语言模型
计算与语言
2025-03-11 v2 机器学习
摘要
尽管扩散模型在条件生成高质量图像方面表现出色,但先前的离散扩散模型在条件长文本生成方面未得到评估。本文解决了先前离散扩散模型在条件长文本生成中的局限性,尤其是在如摘要等长序列到序列任务中。尽管相较于自回归方法具有更快的解码速度,但之前的扩散模型在摘要任务中仍未取得好结果,由于背板架构与随机加噪过程之间的不兼容。为克服这些挑战,我们引入了一种新型语义感知加噪过程,使 Transformer 主干网络能够有效处理长序列。此外,我们提出了 CrossMamba,将 Mamba 模型应用于编码器-解码器范式的方案,其能够无缝集成随机吸收加噪过程。我们的做法在三个摘要基准数据集(Gigaword、CNN/DailyMail 和 Arxiv)上实现了最先进的性能,在 ROUGE 指标上超越了现有的离散扩散模型,同时在推理速度上也显著快于自回归模型。
引用
@article{arxiv.2407.10998,
title = {Discrete Diffusion Language Model for Efficient Text Summarization},
author = {Do Huu Dat and Do Duc Anh and Anh Tuan Luu and Wray Buntine},
journal= {arXiv preprint arXiv:2407.10998},
year = {2025}
}