中文

ViT-Lens:迈向全模态表征

计算机视觉与模式识别 2024-03-27 v2 人工智能

摘要

为推动 AI 智能体发展,大型基础模型显著提升了推理与指令执行能力,但当前对视觉与语言的关注忽视了在开放世界环境中感知多样模态的潜力。然而,数据驱动的视觉与语言模型的成功,对于稀有模态而言成本高昂甚至难以复现。本文提出 ViT-Lens-2,通过用预训练 ViT 感知新模态并将其对齐至预定义空间,促进高效的全模态表征学习。具体而言,模态特定的 lens 被调优以将任意模态信号投影到中间嵌入空间,随后由具备预训练视觉知识的强大 ViT 处理。编码后的表征被优化以对齐由现成基础模型定义的模态无关空间。ViT-Lens-2 为日益增多的模态表征学习提供统一方案,具有两项突出优势:(i) 以高效数据机制用预训练 ViT 解锁其对新模态的巨大潜力;(ii) 通过模态对齐与共享 ViT 参数实现涌现的下游能力。我们定制 ViT-Lens-2 来学习 3D 点云、深度、音频、触觉与 EEG 的表征,并在零样本分类等多种理解任务上创下新的最先进结果。通过将 ViT-Lens-2 无缝集成到多模态基础模型中,我们以零样本方式实现了任意模态到文本与图像的生成。代码与模型见 https://github.com/TencentARC/ViT-Lens。

关键词

引用

@article{arxiv.2311.16081,
  title  = {ViT-Lens: Towards Omni-modal Representations},
  author = {Weixian Lei and Yixiao Ge and Kun Yi and Jianfeng Zhang and Difei Gao and Dylan Sun and Yuying Ge and Ying Shan and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2311.16081},
  year   = {2024}
}

备注

This work is a follow-up of arXiv:2308.10185. Accepted to CVPR2024