中文

引领扩散语言模型及其变体未来的十大开放挑战

计算与语言 2026-01-21 v1 人工智能

摘要

当前,大语言模型(LLM)的范式由自回归(AR)架构定义,该架构通过一个顺序的“逐块构建”过程生成文本。尽管取得了成功,但 AR 模型固有地受到因果瓶颈的限制,这限制了全局结构前瞻性和迭代优化能力。扩散语言模型(DLM)提供了一种变革性的替代方案,它将文本生成概念化为一个整体的、双向的去噪过程,类似于雕塑家精雕细琢一件杰作。然而,DLM 的潜力在很大程度上仍未得到开发,因为它们常常被限制在 AR 遗留的基础设施和优化框架内。在这篇前瞻性文章中,我们指出了十个根本性挑战,从架构惯性和梯度稀疏性到线性推理的局限性,这些挑战阻碍了 DLM 迎来它们的“GPT-4 时刻”。我们提出了一个围绕四大支柱组织的战略路线图:基础基础设施、算法优化、认知推理和统一多模态智能。通过转向以多尺度分词、主动重掩码和潜在思维为特征的扩散原生生态系统,我们可以超越因果视野的限制。我们认为,这种转变对于开发能够进行复杂结构推理、动态自我修正和无缝多模态融合的下一代人工智能至关重要。

关键词

引用

@article{arxiv.2601.14041,
  title  = {Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants},
  author = {Yunhe Wang and Kai Han and Huiling Zhen and Yuchuan Tian and Hanting Chen and Yongbing Huang and Yufei Cui and Yingte Shu and Shan Gao and Ismail Elezi and Roy Vaughan Miles and Songcen Xu and Feng Wen and Chao Xu and Sinan Zeng and Dacheng Tao},
  journal= {arXiv preprint arXiv:2601.14041},
  year   = {2026}
}