中文

ODI-Bench:多模态大语言模型是否能理解沉浸式全景环境?

计算机视觉与模式识别 2026-03-10 v2

摘要

全景图像(ODIs)提供 360x180 度的全视野,广泛应用于 VR、AR 和具身智能应用。虽然多模态大语言模型(MLLMs)在常规 2D 图像和视频理解基准中展现出卓越性能,但其理解由 ODIs 捕捉的沉浸式环境的能力仍鲜有探索。为填补这一空白,我们首先提出 ODI-Bench,一个专为全景图像理解设计的新型综合基准测试。ODI-Bench 包含 2000 张高质量全景图像和 4000 多对手动标注的问答对,覆盖 10 个细粒度任务,涵盖一般层面和空间层面的 ODI 解释。在进行大量实验后,我们对 20 个代表性 MLLMs(包括专有和开源模型)进行基准测试,分别在封闭式和开放式设置下进行测试。实验结果表明,当前 MLLMs 在捕捉 ODIs 提供的沉浸式上下文方面仍存在挑战。为此,我们进一步引入 Omni-CoT,通过在文本信息和视觉线索之间进行链式思考,显著提升了 MLLMs 对全景环境的理解能力。该基准和代码将在 https://github.com/ylylyl-sjtu/ODI-Bench 上发布。

关键词

引用

@article{arxiv.2510.11549,
  title  = {ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?},
  author = {Liu Yang and Huiyu Duan and Ran Tao and Juntao Cheng and Sijing Wu and Yunhao Li and Jing Liu and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2510.11549},
  year   = {2026}
}