中文

安全导向流(SGF):统一的负面引导安全生成框架

计算机视觉与模式识别 2026-03-17 v1 人工智能

摘要

扩散和流模型的安全机制最近沿着两种不同路径发展:在机器人规划中,采用控制屏障函数在每个去噪步骤通过显式施加几何约束引导生成轨迹远离障碍物;另一方面,近期数据驱动的负面引导方法被展示用于抑制有害内容并促进生成样本的多样性。然而,他们依赖于启发式方法,未明确阐述何时需要安全引导。本文首先引入一个统一的概率框架,使用最大均值差异(MMD)势能用于图像生成任务,将Shielded Diffusion和Safe Denoiser都视为我们能量基负面引导的实例,以应对不安全数据样本。此外,我们利用控制屏障函数分析,论证存在一个临界时间窗口,负面引导必须在此窗口内发挥强大作用;在此窗口之外,引导应衰减为零,以确保安全且高质量的生成。我们在多个真实可行的安全生成场景中评估了统一框架,确认负面引导应在去噪过程的早期阶段应用,以实现成功的安全生成。

关键词

引用

@article{arxiv.2603.13300,
  title  = {Safety-Guided Flow (SGF): A Unified Framework for Negative Guidance in Safe Generation},
  author = {Mingyu Kim and Young-Heon Kim and Mijung Park},
  journal= {arXiv preprint arXiv:2603.13300},
  year   = {2026}
}

备注

ICLR2026 Oral, Code is available at https://github.com/MingyuKim87/SGF