AutoDebias: 文本到图像模型去偏的自动化框架
计算机视觉与模式识别
2026-03-02 v2
摘要
文本到图像模型能生成高质量图像,但容易受到恶意后门攻击,这些攻击会注入有害偏见(例如,触发器激活的性别或种族刻板印象)。现有的去偏方法通常针对自然统计偏差设计,难以应对这些蓄意且隐蔽注入的攻击。我们提出了 AutoDebias,一个无需预先了解特定攻击类型即可自动识别和缓解文本到图像模型中这些恶意偏见的框架。具体来说,AutoDebias 利用视觉-语言模型检测触发器激活的视觉模式,并通过生成反提示来构建中和引导。这些引导驱动一个 CLIP 引导的训练过程,该过程在保持原始模型图像质量和多样性的同时,打破有害关联。与为自然偏差设计的方法不同,AutoDebias 能有效处理微妙的注入刻板印象和多个相互作用的攻击。我们在一个涵盖 17 种不同后门场景的新基准上评估了该框架,包括多个后门共存的挑战性案例。AutoDebias 以 91.6% 的准确率检测恶意模式,并将后门成功率从 90% 降低到可忽略的水平,同时保持了原始模型的视觉保真度。
引用
@article{arxiv.2508.00445,
title = {AutoDebias: Automated Framework for Debiasing Text-to-Image Models},
author = {Hongyi Cai and Mohammad Mahdinur Rahman and Mingkang Dong and Muxin Pu and Moqyad Alqaily and Jie Li and Xinfeng Li and Jialie Shen and Meikang Qiu and Qingsong Wen},
journal= {arXiv preprint arXiv:2508.00445},
year = {2026}
}
备注
Accepted to CVPR 2026