差分隐私多模态情境学习
人工智能
2026-03-06 v1
摘要
视觉语言模型正在日益应用于敏感领域,如医学成像和个人摄影,但现有的差分隐私方法仅限于少量样本、文本唯一的情境学习设置,因为隐私成本随处理的标记数目而增长。我们提出差分隐私多模态任务向量(DP-MTV),首个实现许量模态情境学习并具备形式差分隐私的框架,通过在激活空间聚合数百个示范样本为紧凑任务向量。DP-MTV将私有数据划分为互斥块,按层应用裁剪以界定灵敏度,并添加校准噪声,仅需一次噪声添加即可实现无限推理查询。我们在三个VLM架构的八个基准上进行评估,支持带或不带辅助数据的部署。在时,DP-MTV在VizWiz上实现50%的准确率,分别与55%的非私有和35%的零样本结果相当,在有意义的隐私约束下仍保留了大部分情境学习收益。
引用
@article{arxiv.2603.04894,
title = {Differentially Private Multimodal In-Context Learning},
author = {Ivoline C. Ngong and Zarreen Reza and Joseph P. Near},
journal= {arXiv preprint arXiv:2603.04894},
year = {2026}
}