运用 PAC-Bayesian 理论提升文本到图像扩散模型的潜力
计算机视觉与模式识别
2024-11-27 v1 机器学习
机器学习
摘要
文本到图像 (T2I) 扩散模型已通过产生高保真、多样且视觉上逼真的图像而革新了生成模型。尽管如此,现有模型在处理涉及多个对象和属性的复杂提示时仍感到挑战,常常将修饰语与其对应名词错位或忽略某些元素。最近的注意力方法改进了对象包含和语言绑定,但仍面临属性错位和缺乏稳健泛化保证的挑战。利用 PAC-Bayes 框架,我们提出了一种贝叶斯方法,通过设计针对注意力分布的自定义先验来强制实现可取属性,包括对象间的差异、修饰语与其对应名词间的对齐、对无关标记的最小注意以及更好的泛化正则化。我们的做法将注意力机制视为可解释组件,从而实现细粒度控制并提高属性-对象对齐。我们在标准基准测试上展示了方法的有效性,实现了多个指标上的最先进结果。通过将自定义先验集成到去噪过程中,我们的方法提升了图像质量,解决了 T2I 扩散模型长期以来的挑战,为可靠且可解释的生成模型铺平了道路。
关键词
引用
@article{arxiv.2411.17472,
title = {Unlocking the Potential of Text-to-Image Diffusion with PAC-Bayesian Theory},
author = {Eric Hanchen Jiang and Yasi Zhang and Zhi Zhang and Yixin Wan and Andrew Lizarraga and Shufan Li and Ying Nian Wu},
journal= {arXiv preprint arXiv:2411.17472},
year = {2024}
}