从相关全景图构建全向空间模型
计算机视觉与模式识别
2025-09-03 v1
摘要
全向场景理解对各种下游应用至关重要,包括具身 AI、自动驾驶和沉浸式环境,但由于 360{\deg} 图像中的几何畸变和复杂空间关系,仍然具有挑战性。现有的全向方法在单个画框内实现场景理解,却忽略了跨画框相关全景图。为弥合这一差距,我们引入了 \textbf{CFpano},即专为跨画框相关全景图视觉问答(VQA)而建立的首个基准数据集,覆盖整体 360{\deg} 场景。CFpano 包含超过 2700 张图像,配有 8000 多条问答对,其中问题类型包括多选题和开放式 VQA。基于我们的 CFpano,我们进一步提出 \methodname,这是一种使用组相对政策优化(GRPO)微调的多模态大语言模型(MLLM),并针对跨画框相关全景图设计了一套量化奖励函数,以实现稳健且一致的推理。在我们的 CFpano 上进行基准实验,比较现有 MLLM。实验结果表明,\methodname 在两类 VQA 任务中均实现了最佳性能,在所有主要推理类别中均优于强基准(\textbf{+5.37\%} 的整体性能提升)。我们的分析验证了 GRPO 的有效性,并为全景场景理解建立了新的基准。
引用
@article{arxiv.2509.02164,
title = {Omnidirectional Spatial Modeling from Correlated Panoramas},
author = {Xinshen Zhang and Tongxi Fu and Xu Zheng},
journal= {arXiv preprint arXiv:2509.02164},
year = {2025}
}