Tango3D:迈向全局与局部二维-三维对应的对齐
计算机视觉与模式识别
2026-05-20 v1
摘要
现有的三维基础模型通常将点云对齐到如 CLIP 等冻结的视觉-语言空间,通过将三维形状压缩为全局向量来实现强大的跨模态检索。然而,这种仅全局对齐无法建立细粒度的像素到点对应。为解决此问题,我们提出了 Tango3D,一个统一了密集对应与全局检索的基础模型。我们使用几何感知的二维视觉骨干网络和预训练的三维 VAE,将图像编码为二维块,将点云编码为三维令牌。这些被映射到单一共享空间中,以实现局部像素到点对齐和全局语义对齐。为稳定密集与全局目标的联合学习,我们引入了一种三阶段渐进式训练策略。实验表明,我们的模型成功实现了物体级别的像素到点对齐,同时保持了有竞争力的全局检索能力,这是现有三维基础模型所不具备的联合能力。通过建立细粒度的对齐特征空间,Tango3D 为纯几何的三维令牌注入了丰富的语义,为广泛的密集三维下游任务铺平了道路。
引用
@article{arxiv.2605.19727,
title = {Tango3D: Towards Alignment for Global and Local 2D-3D Correspondence},
author = {Zebin He and Mingxin Yang and Shuhui Yang and Hanxiao Sun and Xintong Han and Chunchao Guo and Wenhan Luo},
journal= {arXiv preprint arXiv:2605.19727},
year = {2026}
}