中文

视觉语言模型在哪些隐私属性上达成一致并预测良好?

计算机视觉与模式识别 2026-02-10 v1

摘要

视觉语言模型(VLM)通常用于图像中视觉属性的零样本检测。我们针对与隐私相关的属性识别,对开源 VLM 进行了零样本评估。我们识别出 VLM 表现出强标注者间一致性的属性,并讨论了人类和 VLM 标注不一致的情况。我们的结果表明,当与人类标注进行比较时,VLM 倾向于比人类标注者更频繁地预测隐私属性的存在。此外,我们发现,在 VLM 之间标注者间一致性高的情况下,它们可以通过识别被人类标注者忽略的属性来补充人类标注。这突显了 VLM 在支持大规模图像数据集中的隐私标注方面的潜力。

关键词

引用

@article{arxiv.2602.07931,
  title  = {Which private attributes do VLMs agree on and predict well?},
  author = {Olena Hrynenko and Darya Baranouskaya and Alina Elena Baia and Andrea Cavallaro},
  journal= {arXiv preprint arXiv:2602.07931},
  year   = {2026}
}

备注

This work has been accepted to the ICASSP 2026