中文

检测增强现实中的视觉信息操纵攻击:一种多模态语义推理方法

计算机视觉与模式识别 2025-09-03 v4

摘要

增强现实(AR)中的虚拟内容可能引入误导性或有害信息,导致语义误解或用户错误。在本工作中,我们聚焦于增强现实中的视觉信息操纵(VIM)攻击,后者以 subtly但影响深远的方式改变真实世界场景的含义。我们提出了一种分类法,将这些攻击分为三种格式:字符、短语和模式操纵,以及三种目的:信息替换、信息遮蔽和额外错误信息。在该分类法基础上,我们构建了一个数据集 AR-VIM,包含 452 对原始 AR 视频,涵盖 202 种不同场景,每个场景都模拟了真实的 AR 场景。为检测数据集中的攻击,我们提出了一种多模态语义推理框架 VIM-Sense。它结合了视觉语言模型(VLM)的语言和视觉理解能力,以及基于光学字符识别(OCR)的文本分析。VIM-Sense 在 AR-VIM 数据集上实现了 88.94% 的攻击检测准确率,持续优于仅视觉和仅文本的基线方法。该系统在模拟视频处理框架中实现平均攻击检测延迟为 7.07 秒,在在 Android AR 应用程序上的真实世界评估中实现 7.17 秒。

关键词

引用

@article{arxiv.2507.20356,
  title  = {Detecting Visual Information Manipulation Attacks in Augmented Reality: A Multimodal Semantic Reasoning Approach},
  author = {Yanming Xiu and Maria Gorlatova},
  journal= {arXiv preprint arXiv:2507.20356},
  year   = {2025}
}

备注

The paper has been accepted to the 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR), and selected for publication in the 2025 IEEE Transactions on Visualization and Computer Graphics (TVCG) special issue