迈向全面的场景理解:为 LVLMs 整合第一人称与第三人称视角
计算机视觉与模式识别
2025-10-27 v2 人工智能
摘要
大型视觉语言模型日益被部署于虚拟现实与增强现实等交互应用中,其中由头戴式摄像头捕获的第一人称(egocentric)视角作为关键输入。尽管该视角提供了关于用户注意力和手-物交互的细粒度线索,但其狭窄的视野和全局上下文的缺乏常导致在空间或上下文要求较高的查询上失败。为解决此问题,我们引入了一个用第三人称(exocentric)视角增强自我中心输入的框架,为 LVLMs 提供互补信息,如全局场景布局和物体可见性。我们提出了 E3VQA,这是首个基于同步的 ego-exo 图像对构建、包含 4K 高质量问答对的多视角问答基准。此外,我们提出了 M3CoT,一种无需训练的提示技术,通过整合来自三个互补视角的场景图来构建统一的场景表示。M3CoT 使 LVLMs 能够跨视角更有效地推理,相较于近期的 CoT 基线产生了持续的性能提升(GPT-4o 提升 4.84%,Gemini 2.0 Flash 提升 5.94%)。我们的广泛评估揭示了 LVLMs 在多视角推理中的关键优势与局限性,并突出了同时利用自我中心与非自我中心输入的价值。数据集与源代码可在 https://github.com/Leeinsu1/Towards-Comprehensive-Scene-Understanding 获取。
引用
@article{arxiv.2505.21955,
title = {Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs},
author = {Insu Lee and Wooje Park and Jaeyun Jang and Minyoung Noh and Kyuhong Shim and Byonghyo Shim},
journal= {arXiv preprint arXiv:2505.21955},
year = {2025}
}
备注
Accepted to NeurIPS 2025 (Spotlight)