中文

UniCorrn:跨 2D 与 3D 的统一对应 Transformer

计算机视觉与模式识别 2026-05-06 v1

摘要

跨图像到图像(2D-2D)、图像到点云(2D-3D)以及点云到点云(3D-3D)几何匹配的视觉对应构成了众多 3D 视觉任务的基础。尽管具有相似的问题结构,当前方法仍采用针对特定任务的设计,为每种模态组合使用单独的模型。我们提出了 UniCorrn,这是第一个具有共享权重的对应模型,统一了所有三个任务的几何匹配。我们的核心洞察是 Transformer 注意力自然能捕捉跨模态特征相似性。我们提出了一种双流解码器,保持独立的外观和位置特征流。这种设计通过可堆叠层实现端到端学习,同时支持跨异构模态的基于灵活查询的对应估计。我们的架构采用特定模态的主干网络,随后是共享的编码器和解码器组件,在结合来自深度图的伪点云和真实 3D 对应标注的多样化数据上联合训练。UniCorrn 在 2D-2D 匹配上取得了有竞争力的性能,并在配准召回率上比先前 SOTA 在 7Scenes (2D-3D) 上高出 8%,在 3DLoMatch (3D-3D) 上高出 10%。项目网站:https://neu-vi.github.io/UniCorrn

关键词

引用

@article{arxiv.2605.04044,
  title  = {UniCorrn: Unified Correspondence Transformer Across 2D and 3D},
  author = {Prajnan Goswami and Tianye Ding and Feng Liu and Huaizu Jiang},
  journal= {arXiv preprint arXiv:2605.04044},
  year   = {2026}
}

备注

CVPR 2026, 20 pages