中文

Dense360:从全景全景图中进行稠密理解

计算机视觉与模式识别 2025-06-18 v1

摘要

多模态大语言模型(Multimodal Large Language Models, MLLMs)需要综合的视觉输入才能实现对物理世界的稠密理解。虽然现有的MLLMs通过受限视场(Field-of-View, FOV)视觉输入(例如70度)展示了惊人的世界理解能力,但我们首次致力于从全景全景图中进行稠密理解。我们首先引入了一个包含可靠性评分标注的全景全景图数据集。具体而言,我们的数据集包含16万张全景图,配有500万张稠密实体级标题、100万条唯一指代表达,以及10万条以实体为导向的全景场景描述。与多视图方案相比,全景图可以通过等距矩形投影(Equirectangular Projection, ERP)提供更完整、更紧凑、更连续的场景表示。然而,ERP的使用为MLLMs带来了两个关键挑战:i)沿纬度圆的空间连续性,ii)纬度相关的信息密度变化。我们通过专为全景ERP设计的ERP-RoPE位置编码方案来解决这些挑战。此外,我们引入了Dense360-Bench,用于评估MLLMs在全景标题生成和指代 grounding 方面的性能,建立了全面框架以推动全景环境下稠密视觉语言理解的发展。

关键词

引用

@article{arxiv.2506.14471,
  title  = {Dense360: Dense Understanding from Omnidirectional Panoramas},
  author = {Yikang Zhou and Tao Zhang and Dizhe Zhang and Shunping Ji and Xiangtai Li and Lu Qi},
  journal= {arXiv preprint arXiv:2506.14471},
  year   = {2025}
}