中文

基于检测-抑制的文本到图像扩散区域安全控制 SafeCtrl

计算机视觉与模式识别 2025-08-19 v1

摘要

文本到图像模型的广泛部署面临其生成有害内容的潜在风险。虽然已有安全方法,如提示词改写或模型微调,虽有价值,但往往在安全性和保真度之间存在权衡。最近出现的基于局部化的方法显示出前景,但其依赖于显式的“概念替换”有时会导致语义不一致。为此,我们探索了更灵活的检测-抑制范式。我们引入 SafeCtrl,一个轻量级、非侵入性的插件,首先精确定位不安全内容。与执行硬性 A 到 B 替换不同,SafeCtrl 随后抑制有害语义,允许生成过程自然且连贯地演化为安全、上下文感知的替代方案。我们工作的一个关键方面是采用直接偏好优化(DPO)的新训练策略。我们利用可获得的图像级偏好数据训练该模块,使其能够学习细致的抑制行为,并在推理时无需昂贵的像素级标注即可执行区域导向的干预。大量实验表明,SafeCtrl 在安全性和保真度保持方面显著优于最先进的方法。我们的发现表明,解耦的抑制式控制是构建更负责任的生成模型的高度有效且可扩展的方向。

关键词

引用

@article{arxiv.2508.11904,
  title  = {SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress},
  author = {Lingyun Zhang and Yu Xie and Yanwei Fu and Ping Chen},
  journal= {arXiv preprint arXiv:2508.11904},
  year   = {2025}
}