中文

离散数据的简化与通用遮蔽扩散

机器学习 2025-01-17 v4 机器学习

摘要

遮蔽(或吸收)扩散正被探索作为离散数据生成建模的自回归模型替代方案。然而,该领域的现有工作因模型表述不必要复杂及不同视角间关系不清晰,导致参数化次优、训练目标不清晰以及为对抗这些问题的临时性调整。本文致力于提供一个简单且通用的框架,发掘遮蔽扩散模型的全部潜力。我们展示,遮蔽扩散模型的连续时间变分目标是交叉熵损失的简单加权积分。我们的框架也 enables 训练具状态依赖遮蔽计划的通用遮蔽扩散模型。评估标度为困惑度时,我们在OpenWebText上训练的模型在GPT-2规模上超越了先前的扩散语言模型,并在4个5个零样本语言建模任务中表现优异。此外,我们的模型在像素级图像建模中显著优于之前的离散扩散模型, CIFAR-10为2.75,ImageNet 64x64为3.40比特/维,优于相似规模的自回归模型。我们的代码已公开于https://github.com/google-deepmind/md4。

关键词

引用

@article{arxiv.2406.04329,
  title  = {Simplified and Generalized Masked Diffusion for Discrete Data},
  author = {Jiaxin Shi and Kehang Han and Zhe Wang and Arnaud Doucet and Michalis K. Titsias},
  journal= {arXiv preprint arXiv:2406.04329},
  year   = {2025}
}

备注

NeurIPS 2024. Code is available at: https://github.com/google-deepmind/md4