Detect-and-Guide: 通过指南标记优化实现文本到图像扩散模型的安全自调节
计算机视觉与模式识别
2025-03-20 v1
摘要
文本到图像扩散模型在合成任务中取得了最新的成果,但其在创建有害内容方面的潜在滥用仍引发越来越多的担忧。为缓解这些风险,已发展出概念遗忘和安全指导等事后模型干预技术。然而,微调模型权重或调整扩散模型的隐藏状态 operates in an uninterpretable way,使不清楚中间变量的哪一部分导致不安全生成。这些干预措施在擦除复杂多概念提示中的有害概念时严重影响采样轨迹,从而阻碍其在实际场景中的实际应用。在本工作中,我们提出了安全生成框架 Detect-and-Guide (DAG),利用扩散模型的内部知识,在采样过程中进行自诊断和细粒度自调节。DAG 首先通过优化标记的精炼交叉注意力图检测有害概念,然后应用具有自适应强度和编辑区域的安全指导,以消除不安全的生成。该优化仅需要小型标注数据集,即可提供具有通用性和概念特异性的精确检测图。此外,DAG 不需要对扩散模型进行微调,因此不会损害其生成多样性。在擦除性内容方面的实验表明,DAG 实现了文本跟随性能和有害性缓解在多概念真实提示上的最佳表现。
引用
@article{arxiv.2503.15197,
title = {Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token Optimization},
author = {Feifei Li and Mi Zhang and Yiming Sun and Min Yang},
journal= {arXiv preprint arXiv:2503.15197},
year = {2025}
}
备注
CVPR25