中文

VLM 推理风险在日常个人视频中的基准测试:探讨隐私盲点

人机交互 2025-11-05 v1

摘要

视觉语言模型 (VLM) 的普及带来了来自个人视频的深刻隐私风险。本文针对尚未充分探索的推理隐私威胁——即从数据中推断出敏感个人属性的风险——展开研究。为填补这一空白,我们众包收集了 508 个日常个人视频,来自 58 位个体。随后我们进行了基准测试研究,评估 VLM 推理能力与人类表现的对比。我们的发现揭示了三个关键见解:(1) VLM 拥有超人类的推理能力,显著优于人类评估者,利用从时序流中从对象识别转向行为推断;(2) 推理风险与视频特征和提示策略等因素密切相关;(3) VLM 驱动的解释对推理不可靠,正如我们所揭示的,模型生成的解释与证据影响之间存在偏离,识别 ubiquitous 对象作为误导性混淆因子。

关键词

引用

@article{arxiv.2511.02367,
  title  = {The Pervasive Blind Spot: Benchmarking VLM Inference Risks on Everyday Personal Videos},
  author = {Shuning Zhang and Zhaoxin Li and Changxi Wen and Ying Ma and Simin Li and Gengrui Zhang and Ziyi Zhang and Yibo Meng and Hantao Zhao and Xin Yi and Hewu Li},
  journal= {arXiv preprint arXiv:2511.02367},
  year   = {2025}
}