中文

扩散应从何处进入语言模型?几何引导的隐状态替换

计算与语言 2026-05-15 v1 人工智能

摘要

连续扩散语言模型落后于自回归 Transformer,部分原因在于扩散应用于不适合语言去噪和词元恢复的空间。我们提出了 DiHAL,一种几何引导的扩散-Transformer 混合模型,旨在探究扩散应从何处进入预训练 Transformer。DiHAL 使用基于几何的代理指标对层进行评分,选择扩散友好的隐状态接口,并用扩散桥替换较低的 Transformer 前缀,同时保留上层和原始 LM 头。通过重建所选层的隐状态而非词元,DiHAL 避免了直接的连续到离散恢复。在 8B 规模骨干网络上的实验表明,在固定的桥训练协议下,几何分数能有效预测浅层插入层,并且在匹配扩散/恢复训练预算的诊断比较中,隐状态恢复优于连续扩散基线。这些结果表明,隐状态几何有助于识别基于扩散的替换在预训练语言模型内部的可行位置。

关键词

引用

@article{arxiv.2605.14368,
  title  = {Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement},
  author = {Injin Kong and Hyoungjoon Lee and Yohan Jo},
  journal= {arXiv preprint arXiv:2605.14368},
  year   = {2026}
}