中文

LongLLaDA:扩散 LLM 长上下文能力突破

计算与语言 2025-11-12 v3

摘要

大型语言扩散模型(Large Language Diffusion Models,简称 diffusion LLMs)近年来成为 NLP 研究的重点,旨大量工作聚焦其规模性及下游任务性能。然而,其长上下文能力尚未探索,缺乏系统性分析或上下文扩展方法。本文首次系统性调查扩散 LLMs 与传统自回归 LLMs 的长上下文性能。我们首先识别出扩散 LLMs 独特特征:与自回归模型不同,其在直接上下文外推时保持极佳的困惑度稳定性。此外,当自回归模型在 Needle-In-A-Haystack 任务中遇到超出预训练长度的上下文时,扩散 LLMs 显示出独特的局部感知现象,成功检索最近上下文片段。我们通过旋转位置嵌入(Rotary Position Embedding,RoPE)扩展理论解释了这两种现象。基于这些观察,我们提出 LongLLaDA,一种集成 LLaDA 于 NTK 基RoPE 外推的训练自由方法。我们的结果验证了已建立的外推扩展规律对扩散 LLMs 的上下文窗口扩展仍然有效。此外,我们识别出扩散 LLMs 在某些长上下文任务中超越自回归 LLMs,而在另一些任务中则不足。因此,本研究为扩散 LLMs 首次提出长度外推方法,提供了推进长上下文扩散 LLMs 研究所必需的理论洞见与实证基准。代码已公开于 https://github.com/OpenMOSS/LongLLaDA。

关键词

引用

@article{arxiv.2506.14429,
  title  = {LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs},
  author = {Xiaoran Liu and Yuerong Song and Zhigeng Liu and Zengfeng Huang and Qipeng Guo and Ziwei He and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2506.14429},
  year   = {2025}
}

备注

16 pages, 11 figures, Accepted by AAAI 2026