彩虹填充:缓解指令调优扩散 LLM 中的早期终止问题
人工智能
2025-10-07 v1
摘要
扩散大语言模型(dLLM)作为自回归模型的有前景的替代方案,提供了灵活的生成顺序和在复杂推理任务上的强大性能。然而,指令调优的 dLLM 表现出一个我们称之为 \texttt{<eos>} 溢出的关键漏洞:随着分配的序列长度增加,响应反而变短,坍缩为提前终止或退化为 \texttt{<eos>} 标记的流。虽然在实践中注意到此问题,但尚未进行系统分析。我们追溯其根本原因到 \texttt{<eos>} 作为终止和填充双重角色,导致其在后续位置概率质量集中,并向后传播以触发提前终止。为此,我们引入彩虹填充(Rainbow Padding),一种简单解决方案,将重复的 \texttt{<eos>} 占位符替换为不同填充标记的循环,分布概率质量,打破 \texttt{<eos>} 的主导地位。实验表明,彩虹填充显著改善了长度鲁棒性和输出质量,仅需七个填充标记即可防止提前终止。此方法高效集成到现有指令调优模型中:仅需在最小数据上进行单个 epoch 的 LoRA 微调即可获得显著改进,使本方案高度实用。代码已公开于 https://github.com/quasar529/rainbow-padding。
引用
@article{arxiv.2510.03680,
title = {Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs},
author = {Bumjun Kim and Dongjae Jeon and Dueun Kim and Wonje Jeung and Albert No},
journal= {arXiv preprint arXiv:2510.03680},
year = {2025}
}
备注
25 pages. Project page available at~\url{https://ai-isl.github.io/rainbow-padding}