SPOT:基于总变差的选择性提示投射用于推理-only 安全文本到图像生成
人工智能
2026-05-14 v3
摘要
文本到图像(T2I)扩散模型实现了高质量的开放式合成,但实际应用需要抑制不安全的生成,同时保持对良性提示的行为。我们相对于冻结生成器,采用其基于提示的分布作为保护参考。由于 T2I 安全通常通过对生成图像计算有界风险分数进行评估,总变差(TV)衡量了预期风险从该参考处的变化。我们将此固定参考约束称为安全-提示对齐权衡(SPAT):降低预期不安全性需要提示分布的偏离。为使此偏离具有选择性和可调性,我们定义 tau 安全集作为其参考风险最多为 tau 的提示集合,并将干预称为投射到该集合中靠近的提示上。我们提出选择性提示投射(SPOT),一个无需重新训练生成器或学习类别特定重写器即可实现此投影的推理时间框架。SPOT 使用 LLM 对候选重写进行排序,并在相同的 tau 下使用安全 VLM 接受生成图像。对于四个数据集和三个扩散 backbone,SPOT 在强大的安全对齐基线上实现了 14.2% 至 44.4% 的相对不恰当(IP)得分降低,同时使良性提示行为接近固定参考。
引用
@article{arxiv.2602.00616,
title = {SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation},
author = {Minhyuk Lee and Hyekyung Yoon and Myungjoo Kang},
journal= {arXiv preprint arXiv:2602.00616},
year = {2026}
}