可信文本到图像扩散模型:一项及时且聚焦的综述
机器学习
2025-07-22 v2
摘要
文本到图像扩散模型因其在图像生成方面的显著进展而受到广泛关注。然而,其日益增长的 popularity 引发了与可信度关键非功能属性相关的伦理和社会问题,例如鲁棒性、公平性、安全性、隐私性、事实性和可解释性,这与传统深度学习任务中的情况类似。由于文本到图像扩散模型的独特特性(例如多模态性质),传统深度学习中研究可信度的方法往往效果不佳。鉴于这一挑战,近期研究致力于通过多种手段(包括证伪、增强、验证与确认以及评估)开发研究文本到图像扩散模型可信度的新方法。然而,对于这些非功能属性和手段,目前缺乏深入分析。在本综述中,我们及时且聚焦地回顾了关于可信文本到图像扩散模型的文献,涵盖了从属性、手段、基准和应用角度构建的简洁结构化分类体系。我们的综述首先介绍文本到图像扩散模型的基本预备知识,然后总结特定于文本到图像任务的关键定义/指标,并基于这些定义/指标分析近期文献中提出的手段。此外,我们回顾了文本到图像扩散模型的基准和领域应用。最后,我们指出了当前研究的空白,讨论了现有方法的局限性,并提出了未来研究方向以推动可信文本到图像扩散模型的发展。此外,我们持续更新该领域的最新进展,以跟踪最新发展,并维护我们的 GitHub 仓库:https://github.com/wellzline/Trustworthy_T2I_DMs
引用
@article{arxiv.2409.18214,
title = {Trustworthy Text-to-Image Diffusion Models: A Timely and Focused Survey},
author = {Yi Zhang and Zhen Chen and Chih-Hong Cheng and Wenjie Ruan and Xiaowei Huang and Dezong Zhao and David Flynn and Siddartha Khastgir and Xingyu Zhao},
journal= {arXiv preprint arXiv:2409.18214},
year = {2025}
}
备注
under review