调控掩码扩散语言模型的隐式正则器:通过 k-Parity问题的洞见增强泛化
机器学习
2026-02-02 v1 人工智能
摘要
掩码扩散语言模型(Masked Diffusion Language Models)近期作为强大的生成范式涌现,但其泛化特性相较于自回归模型仍受到不足的关注。本文在 k-Parity问题(计算 k 个相关位的异或和)的设置下,探讨了这些特性。典型情况下,神经网络会表现出“涌现”(grokking)现象,即长期的机会水平性能停滞后突然实现泛化。我们理论上将掩码扩散(MD)目标分解为驱动特征学习的信号段,以及作为隐式正则器的噪声段。通过在 k-Parity问题上使用 MD目标训练 nanoGPT,我们展示MD目标根本性地改变了学习景观,使模型能够实现快速且同步的泛化,而无需经历涌现。进一步,我们利用理论洞见优化MD目标中掩码概率的分布。我们的方法在 5000 万参数模型上显著改善了困惑度,并在从头预训练和监督微调两种方式上均取得优异结果。具体而言,在 80 亿参数模型上,我们观察到分别达到 8.8% 和 5.8% 的性能提升,确认了该框架在大规模掩码扩散语言模型 regime 下的可扩展性与有效性。
引用
@article{arxiv.2601.22450,
title = {Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity},
author = {Jianhao Huang and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2601.22450},
year = {2026}
}