中文

深化理解与评估AR生成场景:当视觉语言模型发光与危机

计算机视觉与模式识别 2025-02-04 v3 人工智能 人机交互

摘要

增强现实(AR)通过集成虚拟内容来提升现实世界,但确保AR体验的质量、可用性和安全性 presents significant challenges。视觉语言模型(VLMs)能否为AR生成场景的自动化评估提供解决方案?本研究评估了三种最先进的商业VLMs——GPT、Gemini和Claude——在识别和描述AR场景方面的能力。为此,我们使用DiverseAR——首个专为评估VLMs分析虚拟内容的AR数据集,覆盖广泛的AR场景复杂性。我们的发现表明,VLMs在感知和描述AR场景方面通常具有能力,感知方的True Positive Rate(TPR)可达93%,描述方可达71%。尽管它们擅长识别显而易见的虚拟物体(如发光的苹果),但在面对无缝集成内容时(如带有逼真阴影的虚拟锅)时仍感到挑战。我们的结果凸显了VLMs在理解AR情境方面的优势与局限。我们确定影响VLMs性能的关键因素,包括虚拟内容放置、渲染质量和物理合理性。本研究强调了VLMs作为评估AR体验质量工具的潜力。

关键词

引用

@article{arxiv.2501.13964,
  title  = {Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble},
  author = {Lin Duan and Yanming Xiu and Maria Gorlatova},
  journal= {arXiv preprint arXiv:2501.13964},
  year   = {2025}
}

备注

6 pages