MoE-DiffuSeq:稀疏注意力与混合专家技术提升长文档扩散模型性能
计算与语言
2026-01-08 v2
摘要
我们提出了 **MoE-DiffuSeq**,这是一款基于扩散模型的长文本生成框架,集成稀疏注意力机制与混合专家(Mixture-of-Experts, MoE)架构。现有序列扩散模型在扩展至长文档时,因稠密注意力和缓慢的迭代重构,面临计算和内存成本的严峻挑战。MoE-DiffuSeq 通过结合专家路由与定制化稀疏注意力机制,大幅降低注意力复杂度,同时保持全局连贯性和文本保真度。在此基础上,我们引入一种“软吸收状态”于扩散过程中,以重塑去噪阶段的注意力动态,实现更快的序列重构和更精确的标记细化。该设计在不牺牲生成质量的前提下,显著加速了训练与采样过程。大量实验表明,MoE-DiffuSeq 在长文档基准测试中,在训练效率、推理速度和生成质量方面均持续优于先前的扩散模型和稀疏注意力基线方法。我们的方案在科学文档生成、大规模代码合成及扩展对话建模等长上下文应用场景中尤为有效,为扩散模型驱动的长篇文本生成树立了可扩展且表现表达的解决方案。
引用
@article{arxiv.2512.20604,
title = {MoE-DiffuSeq: Enhancing Long-Document Diffusion Models with Sparse Attention and Mixture of Experts},
author = {Alexandros Christoforos and Chadbourne Davis},
journal= {arXiv preprint arXiv:2512.20604},
year = {2026}
}
备注
Under submission