中文

Unsafe by Reciprocity: 面向统一多模态模型的生成-理解耦合如何破坏安全性

计算机视觉与模式识别 2026-03-31 v1

摘要

近期大语言模型(LLM)和文本到图像(T2I)模型的快速发展催生了统一多模态模型(UMM),其中的多模态理解与图像生成紧密集成于共享架构中。既有研究表明,这种 reciprocity 通过共享表示和联合优化提升了跨功能性能。然而,UMM安全性的隐含风险尚未得到广泛关注,因为现有安全研究主要独立分析理解与生成功能。本文探讨了跨功能 reciprocity 是否本身构成UMM的结构性安全漏洞。我们提出了RICE:基于互惠交互的跨功能利用攻击范式,显式利用理解与生成之间的双向交互。通过该框架,我们系统评估了生成到理解(G-U)和理解到生成(U-G)的攻击路径,表明不安全的中间信号可跨模态传播并放大安全风险。大量实验表明,两条路径均达到高攻击成功率(ASR),揭示了UMM固有且此前被忽视的安全弱点。

关键词

引用

@article{arxiv.2603.27332,
  title  = {Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models},
  author = {Kaishen Wang and Heng Huang},
  journal= {arXiv preprint arXiv:2603.27332},
  year   = {2026}
}

备注

7 figures, 3 tables