消除文本到图像生成中质量与安全性之间的矛盾之路:数据、方法与评估
计算机视觉与模式识别
2025-11-18 v2
摘要
内容安全是文本到图像(T2I)模型面临的根本性挑战,而现有方法则强化了安全性与生成质量之间的严重权衡。我们认为,缓解这一权衡的关键在于解决当前T2I安全对齐过程中在数据、方法和评估协议方面的系统性挑战。为此,我们提出了一个统一的框架,用于协同安全对齐。首先,为克服提供偏差优化信号的错误数据范式,我们开发了LibraAlign-100K,这是第一个大规模数据集,包含安全性和质量的双重标注。其次,为解决现有方法仅聚焦于安全奖励的单一优化问题,我们提出了Synergistic Preference Optimization(T2I-SPO),这是一种新的对齐算法,将DPO范式扩展于集成生成安全性与质量的复合奖励函数,以全面建模用户偏好。最后,为克服当前评估协议中质量不可知且二元化的局限性,我们引入了统一对齐得分,这是一个全面且细粒度的指标,公正地量化了安全性与生成能力之间的平衡。大量实验表明,T2I-SPO在针对广泛范围的非NSFW概念实现了野对文本到图像安全对齐的先进水平,同时更好地保持了模型的生成质量和通用能力。
引用
@article{arxiv.2504.14290,
title = {The Path to Reconciling Quality and Safety in Text-to-Image Generation: Dataset, Method, and Evaluation},
author = {Shouwei Ruan and Zhenyu Wu and Yao Huang and Ruochen Zhang and Yitong Sun and Caixin Kang and Shiji Zhao and Xingxing Wei},
journal= {arXiv preprint arXiv:2504.14290},
year = {2025}
}
备注
10 pages, 5 figures