DETONATE:面向文本到图像对齐的数据基准与核化直接偏好优化
计算机视觉与模式识别
2025-06-19 v1
摘要
对齐对于确保文本到图像(T2I)模型生成图像忠实于用户意图同时保持安全性与公平性至关重要。直接偏好优化(Direct Preference Optimization,DPO)作为大型语言模型(LLM)中的热门方法,正扩展至T2I系统。本文引入了用于T2I模型的DPO核(DPO-Kernels),通过三个维度提升对齐效果:(i)混合损失,整合基于嵌入的目标与传统概率损失以提升优化效果;(ii)核化表示,采用径向基函数(RBF)、多项式与小波核,以实现更丰富的特征变换并在安全输入与不安全输入之间实现更佳分离;(iii)发散选择,拓展DPO默认的KL散度正则化,纳入Wasserstein散度与Renyi散度,以提升稳定性与鲁棒性。我们引入DETONATE,首个大规模此类数据基准,包含约10万组精选图像对,分为被选取与被拒绝两类。DETONATE涵盖三个社会偏见与歧视轴向:种族、性别与残疾。提示词来源于仇恨言论数据集,图像由主流T2I模型生成,包括Stable Diffusion 3.5 Large、Stable Diffusion XL与Midjourney。此外,我们提出了对齐质量指数(Alignment Quality Index,AQI),一种新型几何度量,用于量化潜在空间中安全/不安全图像激活的可分离性,揭示隐藏漏洞。经验性地,我们证明DPO-Kernels通过重尾自正则化(Heavy-Tailed Self-Regularization,HT-SR)维持强大的泛化界限。DETONATE及完整代码已公开释放。
引用
@article{arxiv.2506.14903,
title = {DETONATE: A Benchmark for Text-to-Image Alignment and Kernelized Direct Preference Optimization},
author = {Renjith Prasad and Abhilekh Borah and Hasnat Md Abdullah and Chathurangi Shyalika and Gurpreet Singh and Ritvik Garimella and Rajarshi Roy and Harshul Surana and Nasrin Imanpour and Suranjana Trivedy and Amit Sheth and Amitava Das},
journal= {arXiv preprint arXiv:2506.14903},
year = {2025}
}
备注
59 pages, 10 figures