神经门控:通过神经元级梯度门控缓解 LVLMs 隐私风险
计算机视觉与模式识别
2026-03-16 v1
摘要
大型视觉-语言模型(LVLMs)在广泛的视觉-语言任务中展现出巨大的潜力,使其在金融和医疗等关键领域得到广泛应用。然而,这些模型的日益普及也带来了显著的安全和隐私风险。恶意行为者可能利用这些模型提取敏感信息,这凸显了关键性漏洞。近期研究表明,LVLMs 往往无法一致拒绝旨在侵犯用户隐私的指令。虽然现有工作在防止敏感数据泄露方面取得了有意义的进展,但受限于泛化性和非破坏性,常常难以稳健地处理未遇到的隐私相关查询,且可能无意中降低模型在标准任务上的性能。为此,我们提出 Neural Gate,一种通过神经元级模型编辑来缓解隐私风险的新方法。该方法通过增加模型对隐私相关问题的拒绝率来提升模型的隐私保护,这一保护行为可扩展至编辑过程中未遇到的新型敏感查询。Neural Gate 通过学习特征向量来识别模型表示中与隐私相关概念相关的神经元。这种局部化精确指导模型参数的更新。通过在 MiniGPT 和 LLaVA 上进行全面实验,我们展示该方法在显著提升模型隐私保护的同时,仍能保持原始效用。
引用
@article{arxiv.2603.12598,
title = {Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating},
author = {Xiangkui Cao and Jie Zhang and Meina Kan and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2603.12598},
year = {2026}
}