中文

MLLMs 360度图像感知:全面基准测试与无训练方法

计算机视觉与模式识别 2026-03-27 v2 人工智能

摘要

多模态大语言模型(MLLMs)在理解和推理常规图像方面展现出惊人的能力。然而,其对 360 度图像的感知仍 largely 未被探索。不同于常规图像,360 度图像捕获整个周围环境,使其能够进行整体空间推理,但引入几何畸变和复杂空间关系等挑战。为全面评估 MLLMs 对 360 度图像的感知能力,我们引入了 360Bench,一个包含 7K 分辨率 360 度图像的视觉问答(VQA)基准测试,包含七个代表性(子)任务,由人类注释者仔细挑选注释。使用 360Bench,我们系统评估了七个 MLLMs 和六种增强方法,揭示了其在 360 度图像感知中的不足。为了应对这些挑战,我们提出了 Free360,一个基于无训练场景图的高分辨率 360 度 VQA 框架。Free360 将推理过程分解为模块化步骤,针对每个步骤应用自适应球面图像变换,并将所需信息无缝集成到统一的图表示中用于答案生成。实验表明,Free360 持续改进其基础 MLLM,为 360 度 VQA 提供了强大的无训练解决方案。源代码和数据集将在接受后公开。

关键词

引用

@article{arxiv.2603.16179,
  title  = {360{\deg} Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method},
  author = {Huyen T. T. Tran and Van-Quang Nguyen and Farros Alferro and Kang-Jun Liu and Takayuki Okatani},
  journal= {arXiv preprint arXiv:2603.16179},
  year   = {2026}
}