中文

[MASK] is All You Need

计算机视觉与模式识别 2024-12-11 v2 人工智能

摘要

在生成模型中,两种范式已在各种应用中获得了关注:基于下一集合预测的掩码生成模型和基于下一噪声预测的非自回归模型,例如扩散模型。在本工作中,我们提出使用离散状态模型来连接它们,并在视觉领域探索其可扩展性。首先,我们在统一的设计空间中对这些模型(包括时间步独立性、噪声调度、温度、引导强度等)进行逐步分析,以可扩展的方式。其次,我们将典型的判别任务,例如图像分割,重新表述为离散状态模型上 [MASK] 令牌的去掩码过程。这使我们能够执行各种采样过程,包括仅通过训练一次来建模联合分布的灵活条件采样。上述所有探索促成了我们名为 Discrete Interpolants 的框架,使我们能够在各种基准测试(如 ImageNet256、MS COCO 和视频数据集 FaceForensics)中实现最先进的或具有竞争力的性能。总之,通过利用离散状态模型中的 [MASK],我们可以连接掩码生成模型和非自回归扩散模型,以及生成任务和判别任务。

关键词

引用

@article{arxiv.2412.06787,
  title  = {[MASK] is All You Need},
  author = {Vincent Tao Hu and Björn Ommer},
  journal= {arXiv preprint arXiv:2412.06787},
  year   = {2024}
}

备注

Technical Report (WIP), Project Page(code, model, dataset): https://compvis.github.io/mask/