UniCorrn:跨 2D 与 3D 的统一对应 Transformer
计算机视觉与模式识别
2026-05-06 v1
摘要
跨图像到图像(2D-2D)、图像到点云(2D-3D)以及点云到点云(3D-3D)几何匹配的视觉对应构成了众多 3D 视觉任务的基础。尽管具有相似的问题结构,当前方法仍采用针对特定任务的设计,为每种模态组合使用单独的模型。我们提出了 UniCorrn,这是第一个具有共享权重的对应模型,统一了所有三个任务的几何匹配。我们的核心洞察是 Transformer 注意力自然能捕捉跨模态特征相似性。我们提出了一种双流解码器,保持独立的外观和位置特征流。这种设计通过可堆叠层实现端到端学习,同时支持跨异构模态的基于灵活查询的对应估计。我们的架构采用特定模态的主干网络,随后是共享的编码器和解码器组件,在结合来自深度图的伪点云和真实 3D 对应标注的多样化数据上联合训练。UniCorrn 在 2D-2D 匹配上取得了有竞争力的性能,并在配准召回率上比先前 SOTA 在 7Scenes (2D-3D) 上高出 8%,在 3DLoMatch (3D-3D) 上高出 10%。项目网站:https://neu-vi.github.io/UniCorrn
关键词
引用
@article{arxiv.2605.04044,
title = {UniCorrn: Unified Correspondence Transformer Across 2D and 3D},
author = {Prajnan Goswami and Tianye Ding and Feng Liu and Huaizu Jiang},
journal= {arXiv preprint arXiv:2605.04044},
year = {2026}
}
备注
CVPR 2026, 20 pages