中文

VLMs 在物理世界中距离隐私意识有多远?一项实证研究

密码学与安全 2026-05-11 v2 人工智能

摘要

随着视觉-语言模型(VLMs)日益部署为具身助理的自主认知核心,评估它们在物理环境中的隐私意识变得至关重要。不同于数字聊天机器人,这些代理在密闭空间中运行,如住宅和医院,拥有观察和操纵隐私敏感信息和制品的物理能动性。然而,当前的基准仅限于单模态、基于文本的表示,无法捕捉现实场景的需求。为填补这一差距,我们提出 ImmersedPrivacy,一个交互式音视频评估框架,使用基于 Unity 的模拟器模拟真实的物理环境。ImmersedPrivacy 测试在三个渐进层次上评估物理性隐私意识:测试模型识别杂乱场景中敏感物品的能力、适应变化的社交背景的能力、解决显式命令与推断隐私约束之间冲突的能力。我们对 12 个最先进模型进行评估,发现表现出一致的缺陷。在杂乱场景中,所有模型都表现出随场景复杂度增长的单调性能衰减,由于感知缺陷。当社交背景变化时,没有模型超过 65% 的选择准确率。在存在冲突命令的情况下,最佳模型 gemini-3.1-pro 仅在 51% 的情况下完美平衡任务完成与隐私保护。这些发现表明,当前的 VLMs 在物理世界中存在感知脆弱性,无法让其对隐私线索的知识支配其局部行为。我们的代码和数据可在 https://github.com/immersed-privacy/immersed-privacy 获取。

关键词

引用

@article{arxiv.2605.05340,
  title  = {How Far Are VLMs from Privacy Awareness in the Physical World? An Empirical Study},
  author = {Junran Wang and Xinjie Shen and Zehao Jin and Pan Li},
  journal= {arXiv preprint arXiv:2605.05340},
  year   = {2026}
}