视觉语言模型在哪些隐私属性上达成一致并预测良好?
计算机视觉与模式识别
2026-02-10 v1
摘要
视觉语言模型(VLM)通常用于图像中视觉属性的零样本检测。我们针对与隐私相关的属性识别,对开源 VLM 进行了零样本评估。我们识别出 VLM 表现出强标注者间一致性的属性,并讨论了人类和 VLM 标注不一致的情况。我们的结果表明,当与人类标注进行比较时,VLM 倾向于比人类标注者更频繁地预测隐私属性的存在。此外,我们发现,在 VLM 之间标注者间一致性高的情况下,它们可以通过识别被人类标注者忽略的属性来补充人类标注。这突显了 VLM 在支持大规模图像数据集中的隐私标注方面的潜力。
引用
@article{arxiv.2602.07931,
title = {Which private attributes do VLMs agree on and predict well?},
author = {Olena Hrynenko and Darya Baranouskaya and Alina Elena Baia and Andrea Cavallaro},
journal= {arXiv preprint arXiv:2602.07931},
year = {2026}
}
备注
This work has been accepted to the ICASSP 2026