夏洛克·福尔摩斯之眼:通过视觉-语言模型智能体框架揭示用户隐私属性画像
计算机视觉与模式识别
2025-05-27 v1
摘要
我们的研究揭示了视觉-语言模型(VLM)智能体框架带来的一种新隐私风险:能够从一组个人图像中推断出敏感属性(如年龄和健康信息)甚至抽象属性(如性格和社会特征),我们将其称为“图像隐私属性画像”。鉴于现代应用程序可以轻易访问用户的相册,且从图像集合进行推断使得模型能够利用图像间关系进行更复杂的画像分析,这种威胁尤为严重。然而,两个主要挑战阻碍了我们理解 VLM 从少数个人照片中对个体进行画像的能力:(1) 缺乏带有私有属性多图像标注的基准数据集,以及 (2) 当前多模态大语言模型(MLLM)从大型图像集合中推断抽象属性的能力有限。在这项工作中,我们构建了 PAPI,这是用于研究个人图像隐私属性画像的最大数据集,包含来自 251 个个体的 2,510 张图像以及 3,012 个标注的隐私属性。我们还提出了 HolmesEye,这是一个结合了 VLM 和 LLM 的混合智能体框架,旨在增强隐私推断。HolmesEye 使用 VLM 提取图像内和图像间信息,并使用 LLM 引导推断过程以及通过取证分析整合结果,从而克服了长上下文视觉推理中现有的局限性。实验表明,HolmesEye 的平均准确率比 SOTA 基线提高了 10.8%,并在预测抽象属性上超越了人类水平 15.0%。这项工作强调了应对基于图像的画像隐私风险的紧迫性,并提供了新的数据集和先进的框架以指导该领域的未来研究。
引用
@article{arxiv.2505.19139,
title = {The Eye of Sherlock Holmes: Uncovering User Private Attribute Profiling via Vision-Language Model Agentic Framework},
author = {Feiran Liu and Yuzhe Zhang and Xinyi Huang and Yinan Peng and Xinfeng Li and Lixu Wang and Yutong Shen and Ranjie Duan and Simeng Qin and Xiaojun Jia and Qingsong Wen and Wei Dong},
journal= {arXiv preprint arXiv:2505.19139},
year = {2025}
}