扩散转换器泛化的归纳偏置研究
计算机视觉与模式识别
2024-10-29 v1
摘要
近期研究表明,基于 UNet 结构的扩散模型在泛化方面揭示了可通过几何自适应谐波基函数表达的归纳偏置。然而,实际中,更近期的去噪网络往往基于转换器结构,例如扩散转换器 (DiT)。这引发了一个问题:基于转换器的去噪网络是否也具有可通过几何自适应谐波基函数表达的归纳偏置?我们惊讶地发现答案是否定的。这一差异激励我们寻找能够导致 DiT 良好泛化的归纳偏置。调查 DiT 关键注意力模块后,我们发现注意力图的局部性与泛化紧密相关。为验证这一发现,我们通过限制注意力窗口来修改 DiT 的泛化能力。我们将局部注意力窗口注入 DiT,并观察到其泛化能力的提升。此外,我们经验性地发现,这些局部注意力窗口的位置及其有效注意力范围都是关键因素。在 CelebA、ImageNet 和 LSUN 数据集上进行的实验表明,增强 DiT 的归纳偏置可以在数据更有限时提升其泛化能力和生成质量。项目页面: dit-generalization.github.io/。
引用
@article{arxiv.2410.21273,
title = {On Inductive Biases That Enable Generalization of Diffusion Transformers},
author = {Jie An and De Wang and Pengsheng Guo and Jiebo Luo and Alexander Schwing},
journal= {arXiv preprint arXiv:2410.21273},
year = {2024}
}
备注
Project page: https://dit-generalization.github.io; Code repository: https://github.com/DiT-Generalization/DiT-Generalization