中文

击败Cerberus:多模态语言模型中基于概念的隐私泄露缓解

密码学与安全 2025-10-01 v1 机器学习

摘要

多模态大语言模型(MLLMs)在处理和推理多种模态方面展现了卓越能力,但其先进能力也引发了重大的隐私担忧,特别是关于个人身份信息(PII)泄露。虽然相关研究已在单模态语言模型上有所开展,但多模态设置中的漏洞尚未得到充分调查。在这项工作中,我们调查了这些新兴风险,重点关注视觉语言模型(VLMs),这是MLLMs的一个代表性子类,涵盖了与PII泄露最相关的两种模态——视觉和文本。我们提出了一种概念引导的缓解方法,识别并修改模型内部与PII相关内容关联的状态。我们的方法引导VLMs有效且高效地拒绝PII敏感任务,无需重新训练或微调。我们还通过构建模拟真实场景的各种数据集来解决当前多模态PII数据集缺乏的问题。实验结果表明,该方法在各种PII相关任务上实现了平均93.3%的拒绝率,且对无关模型性能的影响最小。我们进一步在不同条件下检验了缓解方法的性能,以展示所提出方法的适应性。

关键词

引用

@article{arxiv.2509.25525,
  title  = {Defeating Cerberus: Concept-Guided Privacy-Leakage Mitigation in Multimodal Language Models},
  author = {Boyang Zhang and Istemi Ekin Akkus and Ruichuan Chen and Alice Dethise and Klaus Satzke and Ivica Rimac and Yang Zhang},
  journal= {arXiv preprint arXiv:2509.25525},
  year   = {2025}
}