中文

TAMM:用于 3D 形状理解的 TriAdapter 多模态学习

计算机视觉与模式识别 2024-04-03 v2

摘要

当前 3D 形状数据集的有限规模阻碍了 3D 形状理解的进展,并激发了多模态学习方法,即将从数据丰富的 2D 图像和语言模态中学到的知识迁移到 3D 形状。然而,尽管图像和语言表示已通过 CLIP 等跨模态模型对齐,我们发现现有的多模态 3D 表示学习方法中,图像模态的贡献不如语言模态。这归因于 2D 图像中的域偏移以及各模态的不同关注点。为了在预训练中更有效地利用这两种模态,我们引入了 TriAdapter 多模态学习 (TAMM)——一种基于三个协同适配器的新颖两阶段学习方法。首先,我们的 CLIP 图像适配器通过为合成图像 - 文本对调整 CLIP 的视觉表示,缓解了 3D 渲染图像与自然图像之间的域差距。随后,我们的双适配器将 3D 形状表示空间解耦为两个互补的子空间:一个专注于视觉属性,另一个专注于语义理解,从而确保更全面和有效的多模态预训练。大量实验表明,TAMM 一致地增强了各种 3D 编码器架构、预训练数据集和下游任务的 3D 表示。值得注意的是,我们将 Objaverse-LVIS 上的零样本分类准确率从 46.8\% 提升至 50.7\%,并将 ModelNet40 上的 5-way 10-shot 线性探测分类准确率从 96.1\% 提升至 99.0\%。项目页面:https://alanzhangcs.github.io/tamm-page。

关键词

引用

@article{arxiv.2402.18490,
  title  = {TAMM: TriAdapter Multi-Modal Learning for 3D Shape Understanding},
  author = {Zhihao Zhang and Shengcao Cao and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2402.18490},
  year   = {2024}
}

备注

This paper is accepted by CVPR 2024