中文

SA-DiffuSeq:针对长文档生成的计算与可扩展性挑战的稀疏注意力方法

计算与语言 2025-12-25 v1 人工智能

摘要

基于扩散的方法用于长文本生成在序列长度增加时 suffer from 巨大的计算成本和内存开销。我们引入 SA-DiffuSeq,一种集成稀疏注意力机制的扩散框架,从根本上提升了长文档建模的可扩展性。通过在扩散过程中有选择地分配注意力,SA-DiffuSeq 显著降低了计算复杂度,同时保持语义连贯性和生成质量。我们方法的一个关键组件是针对稀疏注意力动态设计的软吸收状态,该状态稳定了扩散轨迹并加速序列重建。这种设计提高了采样效率并增强了长程依赖建模的精度。广泛的实验表明,SA-DiffuSeq 在训练效率和采样速度方面 consistently 超过了最先进的扩散基线,尤其在扩展序列上取得显著提升。这些特性使 SA-DiffuSeq 特别适用于科学写作、大规模代码生成和多轮长上下文对话等高要求的长文本应用。总体而言,我们的结果表明,将结构化稀疏性引入扩散模型是提高高效性和表达力进行长文本生成的有前景的方向。

关键词

引用

@article{arxiv.2512.20724,
  title  = {SA-DiffuSeq: Addressing Computational and Scalability Challenges in Long-Document Generation with Sparse Attention},
  author = {Alexandros Christoforos and Chadbourne Davis},
  journal= {arXiv preprint arXiv:2512.20724},
  year   = {2025}
}

备注

Under submission