中文

双流交互式联合学习场景解析与几何视觉任务

计算机视觉与模式识别 2026-02-17 v1 人工智能

摘要

受人类视觉系统在上下文和空间理解方面 operate on two parallel yet interactive streams 的启发,本文提出Two Interactive Streams(TwInS),一种新颖的类生物学联合学习框架,能够同时执行场景解析和几何视觉任务。TwInS采用统一的、通用的体系结构,其中来自场景解析流的多级上下文特征被注入到几何视觉流中,以指导其迭代细化。在相反方向上,解码的几何特征被投射到上下文特征空间,以通过新颖的跨任务适配器进行选择性异构特征融合,该适配器利用丰富的跨视图几何线索来增强场景解析。为消除对昂贵人工标注对应关系ground truth的依赖,TwInS进一步配备了量身定制的半监督训练策略,释放了大规模多视图数据的潜力,使其能够在无需对应关系ground truth的情况下实现持续自我演化。在三个公开数据集上的广泛实验验证了TwInS核心组件的有效性,并证明其优于现有最先进方法的优越性能。源代码将在发布后公开。

关键词

引用

@article{arxiv.2602.13588,
  title  = {Two-Stream Interactive Joint Learning of Scene Parsing and Geometric Vision Tasks},
  author = {Guanfeng Tang and Hongbo Zhao and Ziwei Long and Jiayao Li and Bohong Xiao and Wei Ye and Hanli Wang and Rui Fan},
  journal= {arXiv preprint arXiv:2602.13588},
  year   = {2026}
}