中文

MTPano:基于无标签整合密集预测先验的多任务全景场景理解

计算机视觉与模式识别 2026-04-29 v2

摘要

全景场景理解对于沉浸式应用至关重要,但由于高分辨率、多任务标注稀缺,仍面临挑战。虽然基于视角的基础模型通过数据扩张取得了成功,但直接适用于全景领域常因严重的几何畸变和坐标系差异而失败。此外,不同稠密预测任务在球面空间中的内在关系尚未得到充分探索。为此,我们提出MTPano,通过无标签训练管道构建鲁棒的多任务全景基础模型。首先,为规避数据稀缺问题,我们利用强大的视角密集先验。将全景图像投影到视角块上,利用即插即用的基础模型生成准确、无领域差距的伪标签,再投影回用于块级监督。其次,为解决任务类型之间的干扰,我们将任务分为旋转不变(如深度、分割)和旋转变化(如法线)两组。引入全景双桥网络(Panoramic Dual BridgeNet),通过几何感知调制层注入绝对位置和射线方向先验,来解耦这些特征流。为处理等距投影(ERP)带来的畸变,我们采用ERP token混合器,随后使用双分支桥接网络进行交互,采用梯度截断以促进有益的跨任务信息共享,同时阻止来自不兼容任务属性的冲突梯度。此外,我们引入辅助任务以促进跨任务学习。大量实验表明,MTPano在多个基准数据集上实现了最佳性能,并对多数全景专家基础模型取得了具竞争力的成绩。

关键词

引用

@article{arxiv.2602.05330,
  title  = {MTPano: Multi-Task Panoramic Scene Understanding via Label-Free Integration of Dense Prediction Priors},
  author = {Jingdong Zhang and Xiaohang Zhan and Lingzhi Zhang and Yizhou Wang and Zhengming Yu and Jionghao Wang and Wenping Wang and Xin Li},
  journal= {arXiv preprint arXiv:2602.05330},
  year   = {2026}
}