中文

ViDDAR:基于视觉语言模型的增强现实中的任务不利内容检测

计算机视觉与模式识别 2025-09-04 v2

摘要

在增强现实(AR)中,虚拟内容通过提供额外信息来提升用户体验。然而,不恰当位置或设计的虚拟内容可能对任务性能产生不利影响,因而阻碍用户准确解读真实世界信息。本文考察两种类型的任务不利虚拟内容:遮挡攻击,即虚拟内容阻止用户看到真实物体;信息操纵攻击,即虚拟内容干扰用户准确解读真实信息。我们提供数学框架来刻画这些攻击,并创建了用于攻击评估的定制开源数据集。为解决这些问题,我们引入ViDDAR(Vision language model-based Task-Detrimental content Detector for Augmented Reality),一个综合性全参考系统,利用视觉语言模型(VLMs)和先进深度学习技术来监控和评估AR环境中的虚拟内容,采用用户边缘云架构以平衡性能与低延迟。据我们所知,ViDDAR是首个在AR设置中运用VLMs进行任务不利内容检测的系统。我们的评估结果表明,ViDDAR能够有效理解复杂场景并检测任务不利内容,在遮挡检测准确率达到92.15%、检测延迟为533 ms;信息操纵内容检测准确率为82.46%,延迟为9.62秒。

关键词

引用

@article{arxiv.2501.12553,
  title  = {ViDDAR: Vision Language Model-Based Task-Detrimental Content Detection for Augmented Reality},
  author = {Yanming Xiu and Tim Scargill and Maria Gorlatova},
  journal= {arXiv preprint arXiv:2501.12553},
  year   = {2025}
}

备注

The paper has been accepted to the 2025 IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR), and selected for publication in the 2025 IEEE Transactions on Visualization and Computer Graphics (TVCG) special issue