中文

评估多模态AI中的视觉隐私风险:一种基于分类法的视觉语言模型评估新方法

计算机视觉与模式识别 2025-09-30 v1 机器学习

摘要

人工智能在近年来深刻改变了技术格局。大语言模型(LLMs)在推理、文本理解、上下文模式识别以及语言与视觉理解的整合方面展示了令人印象深刻的能力。尽管这些进展带来了显著益处,但也揭示了模型在理解隐私概念方面的关键局限性。因此,确定这些模型能否以及如何理解和执行隐私原则具有重大研究价值,特别是在缺乏支持资源来测试此类任务的情况下。在这项工作中,我们通过考察法律框架如何指导这些新兴技术的能力来应对这些挑战。为此,我们引入了一个全面的、多层级的视觉隐私分类法(Visual Privacy Taxonomy),捕捉广泛的隐私问题,设计上具有可扩展性和适应性,以满足现有和未来的研究需求。此外,我们评估了若干最先进的视觉语言模型(VLMs)的能力,揭示了它们在上下文隐私理解上的显著不一致。我们的工作既为未来研究提供了基础分类法,也对当前模型的局限性进行了关键基准测试,展示了开发更强大、隐私感知AI系统的迫切需求。

关键词

引用

@article{arxiv.2509.23827,
  title  = {Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models},
  author = {Efthymios Tsaprazlis and Tiantian Feng and Anil Ramakrishna and Rahul Gupta and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2509.23827},
  year   = {2025}
}