中文

透视他们的眼睛:关于视觉语言模型对社交媒体视频中敏感属性推断的用户感知

人机交互 2025-08-12 v1

摘要

视觉语言模型(VLMs)的快速发展使得对视觉内容进行精细分析成为可能,引发对推断用户敏感属性及随之而来的隐私风险的担忧。尽管技术层面正在得到广泛关注,但用户对这些推断的理解、感知和反应仍较少被探讨,尤其是针对社交媒体平台上上传的视频内容。本文通过进行半结构化访谈(N=17),探讨用户对 VLMs 推断自身视觉数据中敏感属性的看法。研究发现,用户认为 VLMs 能够以相当不安的准确性推断出包括位置、人口学特征和社会经济指标在内的多种属性。关键担忧包括未经授权的身份识别、个人信息滥用、持续监视以及错误推断造成的伤害。参与者报告称,他们采取了多种缓解措施,但对这些措施在面对先进 AI 时的实际效果持怀疑态度。用户还明确表达了对平台和监管机构的期望,强调需要加强透明度、用户控制以及主动隐私保护措施。这些见解对于指导负责任的 AI 系统开发、有效的隐私增强技术以及与用户期望和社会价值相吻合的政策制定具有重要意义。

关键词

引用

@article{arxiv.2508.07658,
  title  = {Through Their Eyes: User Perceptions on Sensitive Attribute Inference of Social Media Videos by Visual Language Models},
  author = {Shuning Zhang and Gengrui Zhang and Yibo Meng and Ziyi Zhang and Hantao Zhao and Xin Yi and Hewu Li},
  journal= {arXiv preprint arXiv:2508.07658},
  year   = {2025}
}