双流交互式联合学习场景解析与几何视觉任务
计算机视觉与模式识别
2026-02-17 v1 人工智能
摘要
受人类视觉系统在上下文和空间理解方面 operate on two parallel yet interactive streams 的启发,本文提出Two Interactive Streams(TwInS),一种新颖的类生物学联合学习框架,能够同时执行场景解析和几何视觉任务。TwInS采用统一的、通用的体系结构,其中来自场景解析流的多级上下文特征被注入到几何视觉流中,以指导其迭代细化。在相反方向上,解码的几何特征被投射到上下文特征空间,以通过新颖的跨任务适配器进行选择性异构特征融合,该适配器利用丰富的跨视图几何线索来增强场景解析。为消除对昂贵人工标注对应关系ground truth的依赖,TwInS进一步配备了量身定制的半监督训练策略,释放了大规模多视图数据的潜力,使其能够在无需对应关系ground truth的情况下实现持续自我演化。在三个公开数据集上的广泛实验验证了TwInS核心组件的有效性,并证明其优于现有最先进方法的优越性能。源代码将在发布后公开。
引用
@article{arxiv.2602.13588,
title = {Two-Stream Interactive Joint Learning of Scene Parsing and Geometric Vision Tasks},
author = {Guanfeng Tang and Hongbo Zhao and Ziwei Long and Jiayao Li and Bohong Xiao and Wei Ye and Hanli Wang and Rui Fan},
journal= {arXiv preprint arXiv:2602.13588},
year = {2026}
}