中文

SafeRoPE: 面向修正流Transformer安全生成的风险特定逐头嵌入旋转

计算机视觉与模式识别 2026-04-03 v1

摘要

基于修正流Transformer(例如SD3、FLUX)的最新文本到图像(T2I)模型实现了高生成保真度,但仍然容易受到不安全语义的影响,尤其是在多token交互触发时。现有的缓解方法主要依赖于微调或注意力调制来进行概念遗忘;然而,它们高昂的计算开销以及针对基于U-Net的去噪器的设计,阻碍了其直接适配到基于Transformer的扩散模型(例如MMDiT)。在本文中,我们对MMDiT中的注意力机制进行了深入分析,发现不安全语义集中在头部级别的可解释、低维子空间中,其中一组有限的安全关键头部负责不安全特征的提取。我们进一步观察到,扰动应用于查询和键向量的旋转位置嵌入(RoPE)可以有效地修改生成图像中的某些特定概念。受这些见解的启发,我们提出了SafeRoPE,一个轻量级且细粒度的MMDiT安全生成框架。具体来说,SafeRoPE首先通过分解安全关键头部内的不安全嵌入来构建头部级不安全子空间,并通过将这些输入向量投影到这些子空间上来计算每个输入向量的潜在风险分数(LRS)。然后,我们引入头部级RoPE扰动,该扰动可以在不降低良性内容或图像质量的情况下抑制不安全语义。SafeRoPE结合了头部级LRS和RoPE扰动,对查询和键向量嵌入执行风险特定的头部级旋转,从而在保持生成保真度的同时实现对不安全输出的精确抑制。大量实验表明,SafeRoPE在平衡MMDiT安全生成的有效有害内容缓解和效用保持方面达到了最先进的性能。代码可在https://github.com/deng12yx/SafeRoPE获取。

关键词

引用

@article{arxiv.2604.01826,
  title  = {SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers},
  author = {Xiang Yang and Feifei Li and Mi Zhang and Geng Hong and Xiaoyu You and Min Yang},
  journal= {arXiv preprint arXiv:2604.01826},
  year   = {2026}
}

备注

CVPR26