中文

VisualLeakBench:审计大型视觉-语言模型针对PII泄露和社交工程的脆弱性

计算机视觉与模式识别 2026-03-17 v1 人工智能 密码学与安全 信息检索

摘要

随着大型视觉-语言模型(LVLMs)在代理集成工作流和其他部署相关场景中的部署增多,其对语义视觉攻击的鲁棒性仍未得到充分评估——通常仅在显式有害内容上测试对齐,而非隐私关键的多模态场景。我们引入VisualLeakBench,一个评估套件用于审计LVLMs针对OCR注入和情境式PII泄露,使用1000个合成生成的对抗图像,包含8种PII类型,在50个真实场景(IRL)真实屏幕截图中进行验证,涵盖多样化的视觉上下文。我们评估了四个前沿系统(GPT-5.2、Claude~4、Gemini-3 Flash、Grok-4),并给出Wilson 95%95\%置信区间。Claude~4实现了最低的OCR ASR( 14.2%14.2\%),但最高的PII ASR( 74.4%74.4\%),表现出一种comply-then-warn模式——即在任何安全导向语言之前,都发生了字面数据披露。Grok-4实现了最低的PII ASR( 20.4%20.4\%)。一个防御性系统提示消除了两个模型的PII泄露,使Claude~4的泄露从 74.4%74.4\% 降至 2.2%2.2\%,但对Gemini-3 Flash没有效果。令人惊讶的是,IRL验证显示Gemini-3 Flash在真实世界图像上对缓解措施有响应(从 50%50\% 降至 0%0\%),表明缓解鲁棒性是模板敏感的,而非普遍缺失。我们发布数据集和代码,用于可复现的鲁棒性和安全评估,以服务于部署相关的视觉-语言系统。

关键词

引用

@article{arxiv.2603.13385,
  title  = {VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering},
  author = {Youting Wang and Yuan Tang and Yitian Qian and Chen Zhao},
  journal= {arXiv preprint arXiv:2603.13385},
  year   = {2026}
}