超越之和:全景-语言模型用于不利全景场景
计算机视觉与模式识别
2026-04-07 v2
摘要
现有的视觉-语言模型 (VLM) 针对针孔图像进行设计,通过拼接多个窄视野输入来构建完整的全景场景理解。然而,这种多视角感知忽略了单个全景天然保留的整体空间和上下文关系。本文引入了全景-语言建模 (PLM) 范式,即一种统一的 视觉-语言推理,凌驫于其针孔模型之上。此外,我们提出 PanoVQA,一个大规模全景 VQA 数据集,涉及不利全景场景,能够在物体遮挡和驾驶事故等情况下进行全面推理。为建立 PLM 的基础,我们开发了一个即插即用的全景稀疏注意力模块,使现有的针孔-based VLM 能够在无需重新训练的情况下处理等距矩形全景。大量实验表明,PLM 在面对挑战性全景场景时实现了卓越的鲁棒性和整体推理,理解能力凌驫于其窄域部分的总和。项目页面: https://github.com/InSAI-Lab/PanoVQA。
引用
@article{arxiv.2603.09573,
title = {More than the Sum: Panorama-Language Models for Adverse Omni-Scenes},
author = {Weijia Fan and Ruiping Liu and Jiale Wei and Yufan Chen and Junwei Zheng and Zichao Zeng and Jiaming Zhang and Qiufu Li and Linlin Shen and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2603.09573},
year = {2026}
}
备注
Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/PanoVQA