RespoDiff: 用于负责任且忠实文本到图像生成的双模块瓶颈变换
计算机视觉与模式识别
2025-10-09 v2 机器学习
摘要
扩散模型的快速发展使高保真度和语义丰富的文本到图像生成成为可能;然而,确保公平性和安全性仍然是一个开放挑战。现有方法通常以牺牲语义保真度和图像质量为代价来改善公平性和安全性。在本工作中,我们提出了RespoDiff,一个用于负责任文本到图像生成的新型框架,通过对扩散模型中间瓶颈表示施加双模块变换。我们的方法引入了两个不同的可学习模块:一个专注于捕捉和强制执行负责任概念(如公平性和安全性),另一个致力于保持与中性提示的语义对齐。为促进双学习过程,我们引入了一种新颖的得分匹配目标,使两个模块能够有效协调。我们的方法在负责任生成方面优于最先进方法,在确保语义对齐的同时优化两个目标,且不损害图像保真度。我们的方法在多样化未见提示上使负责任且语义连贯的生成提升了20%。此外,该方法可以无缝集成到SDXL等大规模模型中,增强公平性和安全性。代码将在接收后发布。
引用
@article{arxiv.2509.15257,
title = {RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation},
author = {Silpa Vadakkeeveetil Sreelatha and Sauradip Nag and Muhammad Awais and Serge Belongie and Anjan Dutta},
journal= {arXiv preprint arXiv:2509.15257},
year = {2025}
}
备注
Accepted at NeurIPS 2025