逃离柏拉图洞穴:迈向 3D 与文本潜在空间的对齐
计算机视觉与模式识别
2025-06-05 v2
摘要
近期工作表明,当进行大规模训练时,单模态 2D 视觉和文本编码器会收敛到共享显著结构性质的学习特征,尽管它们源自不同的表示。然而,3D 编码器相对于其他模态的作用仍未被探索。此外,利用大型数据集的现有 3D 基础模型通常通过与其他表示的冻结编码器的显式对齐目标进行训练。在本工作中,我们研究了从单模态 3D 编码器获得的表示与基于文本的特征空间之间进行事后对齐的可能性。我们表明,单模态文本和 3D 编码器的朴素训练后特征对齐性能有限。随后,我们专注于提取相应特征空间的子空间,并发现通过将学习到的表示投影到精心选择的低维子空间,对齐质量显著提高,从而在匹配和检索任务上带来更好的准确率。我们的分析进一步揭示了这些共享子空间的性质,它们大致区分了语义和几何数据表示。总体而言,我们的工作是首个为 3D 单模态和文本特征空间的训练后对齐建立基线的工作,并有助于突显 3D 数据与其他表示相比的共享和独特性质。我们的代码和权重可在 https://github.com/Souhail-01/3d-text-alignment 获取
引用
@article{arxiv.2503.05283,
title = {Escaping Plato's Cave: Towards the Alignment of 3D and Text Latent Spaces},
author = {Souhail Hadgi and Luca Moschella and Andrea Santilli and Diego Gomez and Qixing Huang and Emanuele Rodolà and Simone Melzi and Maks Ovsjanikov},
journal= {arXiv preprint arXiv:2503.05283},
year = {2025}
}
备注
CVPR 2025