UltraLLaDA:将扩散大型语言模型的上下文长度扩展至 128K
计算与语言
2025-10-14 v1 人工智能
摘要
扩散 LLM 吸引了不断的关注,大量最新工作强调其在各种下游任务中的巨大潜力;然而,扩散 LLM 的长上下文行为仍基本未被探讨。我们对扩散 LLM(即 LLaDA)通过无需从头重新训练的后训练技术以扩展上下文窗口的案例研究。我们表明,一种简单修改标准的旋转位置嵌入(RoPE)扩展有效地适应扩散过程中固有的概率建模,从而实现对更长上下文范围的稳定扩展。我们进一步比较了在后训练期间使用的掩码策略,并分析其对优化稳定性和长程记忆的影响。实例化这些见解,我们提出 UltraLLaDA,一个拥有 128K 标记上下文窗口的扩散 LLM,在我们对长上下文任务的经验评估中显著优于无训练的基线。我们的实验结果突显位置扩展是扩散 LLM 扩展到更长上下文的关键杠杆,并为寻求通过高效后训练实现 128K 规模上下文的实践者提供了实用指导。
引用
@article{arxiv.2510.10481,
title = {UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models},
author = {Guangxin He and Shen Nie and Fengqi Zhu and Yuankang Zhao and Tianyi Bai and Ran Yan and Jie Fu and Chongxuan Li and Binhang Yuan},
journal= {arXiv preprint arXiv:2510.10481},
year = {2025}
}