中文

面向地理位置信息的粒度化隐私控制:基于视觉语言模型

计算与语言 2024-10-18 v2 计算机视觉与模式识别

摘要

视觉语言模型(Vision Language Models, VLMs)在回答信息寻求问题方面的能力正迅速提升。随着这些模型广泛部署于消费级应用,由于其识别照片中人物、对图像进行地理定位等新兴能力,可能带来新的隐私风险。我们所展示的发现表明,当前的开源和专有 VLMs 在图像地理定位方面非常强大,使得使用 VLMs 进行大规模地理位置定位成为一种即时的隐私风险,而不仅仅是未来理论上的顾虑。作为应对这一挑战的第一步,我们开发了新的基准测试 GPTGeoChat,用于测试 VLMs moderating 地理位置对话的能力。我们收集了 1,000 组来自内部标注员与 GPT-4v 之间的图像地理位置对话,并在每个轮次标注所暴露位置信息的粒度。使用这个新数据集,我们评估了 various VLMs moderating GPT-4v 地理位置对话的能力,通过确定是否暴露了过多位置信息来进行评估。我们发现,定制微调的模型在识别暴露的国家或城市级别位置信息时,与 prompted API-based 模型表现相当;然而,对更细粒度(如餐厅或建筑名称)进行微调似乎需要依赖监督数据才能准确地进行 moderating。

关键词

引用

@article{arxiv.2407.04952,
  title  = {Granular Privacy Control for Geolocation with Vision Language Models},
  author = {Ethan Mendes and Yang Chen and James Hays and Sauvik Das and Wei Xu and Alan Ritter},
  journal= {arXiv preprint arXiv:2407.04952},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 main conference