中文

当安全冲突时:通过自适应安全引导解决文本到图像扩散中的多类别有害冲突

计算机视觉与模式识别 2026-03-24 v4

摘要

文本到图像(T2I)扩散模型在生成高质量图像方面取得了显著进展,同时也引发了关于有害内容生成的潜在安全问题。基于安全引导的方法已被提出,通过将生成引导远离有害区域来减轻有害输出,其中区域基于预定义关键词在多个有害类别上取平均。然而,这些方法未能捕捉不同危害类别之间的复杂相互作用,导致“有害冲突”,即减轻一种危害可能无意中放大另一种,从而增加总体有害率。为解决此问题,我们提出冲突感知自适应安全引导(CASG),一个无需训练的框架,在生成过程中动态识别并应用类别对齐的安全方向。CASG由两个组件组成:(i)冲突感知类别识别(CaCI),识别与模型演化生成状态最对齐的有害类别,以及(ii)冲突解决引导应用(CrGA),仅沿识别类别应用安全引导以避免多类别干扰。CASG可应用于潜在空间和文本空间的安全保障。在T2I安全基准上的实验表明,CASG实现了最先进的性能,相比现有方法将有害率降低高达15.4%。

关键词

引用

@article{arxiv.2602.20880,
  title  = {When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance},
  author = {Yongli Xiang and Ziming Hong and Zhaoqing Wang and Xiangyu Zhao and Bo Han and Tongliang Liu},
  journal= {arXiv preprint arXiv:2602.20880},
  year   = {2026}
}

备注

CVPR 2026; Code is released at https://github.com/tmllab/2026_CVPR_CASG