中文

Omnivore:一种适用于多种视觉模态的单模型

计算机视觉与模式识别 2022-04-01 v2 人工智能 信息检索 机器学习

摘要

先前的研究孤立地考察不同的视觉模态,并为图像、视频和三维数据的识别开发了各自的独立架构。相反,本文中我们提出一种单一模型,在使用完全相同模型参数的情况下,擅长对图像、视频和单视图三维数据进行分类。我们的“Omnivore”模型利用了基于 transformer 的架构的灵活性,并在来自不同模态的分类任务上联合训练。Omnivore 训练简单,使用现成的标准数据集,并且性能与同等规模的模态专用模型相当或更好。单个 Omnivore 模型在 ImageNet 上取得 86.0%、在 Kinetics 上取得 84.1%、在 SUN RGB-D 上取得 67.1%。经过微调后,我们的模型在多种视觉任务上优于先前工作,并能跨模态泛化。Omnivore 的共享视觉表征天然支持跨模态识别,而无需模态间的对应关系。我们希望我们的结果能激励研究者将视觉模态放在一起建模。

关键词

引用

@article{arxiv.2201.08377,
  title  = {Omnivore: A Single Model for Many Visual Modalities},
  author = {Rohit Girdhar and Mannat Singh and Nikhila Ravi and Laurens van der Maaten and Armand Joulin and Ishan Misra},
  journal= {arXiv preprint arXiv:2201.08377},
  year   = {2022}
}

备注

Accepted at CVPR 2022 (Oral Presentation)