ViT-Lens:通过 3D 洞察启动全模态探索
计算机视觉与模式识别
2024-03-27 v2
摘要
尽管基于 CLIP 的训练方法在视觉-语言模型中取得成功,但其向更多模态(如 3D、音频等)的可扩展性受限于大规模数据,而对于稀有模态而言,这类数据成本高昂甚至难以获取。本文提出 ViT-Lens,通过用预训练的 ViT 感知新模态并对齐到预定义空间,促进高效的全模态表示学习。具体而言,模态特定的 lens 被调谐以将多模态信号投影到共享嵌入空间,随后由携带预训练图像知识的强大 ViT 处理。编码后的多模态表示被优化以对齐由现成基础模型定义的模态无关空间。训练好的带 ViT 骨干的 lens 有潜力作为这些基础模型之一,监督后续模态的学习。ViT-Lens 为日益增多的模态的表示学习提供统一方案,具有两个突出优势:(i)以高效数据机制跨任务和领域利用预训练 ViT;(ii)由于模态对齐空间,新模态展现出涌现的下游能力。我们以 3D 作为初步验证评估 ViT-Lens。在零样本 3D 分类中,ViT-Lens 较先前最优方法取得显著提升,在 Objaverse-LVIS 上准确率达 52.0%,ModelNet40 上 87.4%,ScanObjectNN 上 60.6%。此外,我们通过将训练好的 3D lens 集成到 InstructBLIP 模型中而无需任何适配,实现了零样本 3D 问答。我们将在近期发布 ViT-Lens 在更多模态上的结果。
引用
@article{arxiv.2308.10185,
title = {ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights},
author = {Weixian Lei and Yixiao Ge and Jianfeng Zhang and Dylan Sun and Kun Yi and Ying Shan and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2308.10185},
year = {2024}
}
备注
19 pages, 4 figures and 9 tables