中文

差分隐私多模态情境学习

人工智能 2026-03-06 v1

摘要

视觉语言模型正在日益应用于敏感领域,如医学成像和个人摄影,但现有的差分隐私方法仅限于少量样本、文本唯一的情境学习设置,因为隐私成本随处理的标记数目而增长。我们提出差分隐私多模态任务向量(DP-MTV),首个实现许量模态情境学习并具备形式(ε,δ)(\varepsilon, \delta)差分隐私的框架,通过在激活空间聚合数百个示范样本为紧凑任务向量。DP-MTV将私有数据划分为互斥块,按层应用裁剪以界定灵敏度,并添加校准噪声,仅需一次噪声添加即可实现无限推理查询。我们在三个VLM架构的八个基准上进行评估,支持带或不带辅助数据的部署。在ε=1.0\varepsilon=1.0时,DP-MTV在VizWiz上实现50%的准确率,分别与55%的非私有和35%的零样本结果相当,在有意义的隐私约束下仍保留了大部分情境学习收益。

关键词

引用

@article{arxiv.2603.04894,
  title  = {Differentially Private Multimodal In-Context Learning},
  author = {Ivoline C. Ngong and Zarreen Reza and Joseph P. Near},
  journal= {arXiv preprint arXiv:2603.04894},
  year   = {2026}
}