中文

面向多模态检索增强生成的身份解耦隐私保护

计算机视觉与模式识别 2026-04-28 v1 信息检索

摘要

多模态检索增强生成(MRAG)系统从大型图像库中检索视觉证据以为多模态大模型的响应提供依据,但检索到的图像经常包含含有敏感个人信息的人脸。现有的隐私保护技术要么破坏下游推理依赖的非身份视觉线索,要么未能提供原则性的隐私保障。我们提出身份解耦MRAG框架,在检索与生成之间插入生成式隐私保护模块。我们的方法包含三个组件:(1)解耦变分编码器,将每个人脸分解为身份代码和空间结构属性代码,由相互信息惩罚和梯度基的独立性项进行正则化;(2)受控拒绝采样器,将身份代码替换为确保既与原件区分又真实可信的合成身份代码;(3)条件潜在扩散生成器,从替换后的身份和保存的属性合成匿名化人脸, distilled into a latent consistency model for low-latency deployment。通过多oracleensemble的人脸识别模型实现隐私保护,采用hinge-based loss的优化一旦身份相似度下降到疑似者阈值以下,即停止优化。

关键词

引用

@article{arxiv.2604.23584,
  title  = {Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation},
  author = {Zehua Cheng and Wei Dai and Jiahao Sun},
  journal= {arXiv preprint arXiv:2604.23584},
  year   = {2026}
}

备注

ACM International Conference on Multimedia Retrieval 2026