中文

用于3D视觉定位的多分支协作学习网络

计算机视觉与模式识别 2024-07-11 v2

摘要

3D指代表达理解(3DREC)和分割(3DRES)具有重叠的目标,表明它们具有协作潜力。然而,现有的协作方法主要依赖一个任务的结果来为另一个任务进行预测,限制了有效的协作。我们认为,为3DREC和3DRES任务使用独立的分支可以增强模型学习每个任务特定信息的能力,使它们能够获取互补知识。因此,我们提出了MCLN框架,该框架包含用于3DREC和3DRES任务的独立分支。这使得能够对每个任务进行专门探索,并在分支之间进行有效协调。此外,为了促进这些分支之间的相互增强,我们引入了相对超点聚合(RSA)模块和自适应软对齐(ASA)模块。这些模块显著有助于精确对齐两个分支的预测结果,引导模块将更多注意力分配到关键位置。全面的实验评估表明,我们提出的方法在3DREC和3DRES任务上均达到了最先进的性能,其中3DREC的[email protected]提升了2.05%,3DRES的mIoU提升了3.96%。

关键词

引用

@article{arxiv.2407.05363,
  title  = {Multi-branch Collaborative Learning Network for 3D Visual Grounding},
  author = {Zhipeng Qian and Yiwei Ma and Zhekai Lin and Jiayi Ji and Xiawu Zheng and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2407.05363},
  year   = {2024}
}

备注

ECCV2024