中文

基于跨视图关联的 3D aware 多任务学习用于稠密场景理解

计算机视觉与模式识别 2025-11-26 v1

摘要

本文旨在解决单一网络同时完成多个稠密预测任务(如分割和深度估计),即多任务学习(MTL)的挑战。当前方法主要在 2D 图像空间中捕捉跨任务关系,常导致特征缺乏 3D 感知性。我们认为,对于建模对全面场景理解至关重要的跨任务关联,3D 感知性至关重要。我们通过在 MTL 网络中集成跨视图(即成本体)之间的关联性,作为几何一致性来解决此问题。具体而言,我们引入一个轻量级的跨视图模块(CvM),在任务之间共享,用于在不同视图之间交换信息并捕捉跨视图关联性,该模块与 MTL 编码器的特征集成用于多任务预测。该模块与体系结构无关,可应用于单视图和多视图数据。在 NYUv2 和 PASCAL-Context 上的大量实验结果表明,我们的方法有效地将几何一致性注入到现有 MTL 方法中,以提升性能。

关键词

引用

@article{arxiv.2511.20646,
  title  = {3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding},
  author = {Xiaoye Wang and Chen Tang and Xiangyu Yue and Wei-Hong Li},
  journal= {arXiv preprint arXiv:2511.20646},
  year   = {2025}
}

备注

3D-aware Multi-task Learning, Cross-view Correlations, Code will be available at https://github.com/WeiHongLee/CrossView3DMTL