Omnivore:一种适用于多种视觉模态的单模型
计算机视觉与模式识别
2022-04-01 v2 人工智能
信息检索
机器学习
摘要
先前的研究孤立地考察不同的视觉模态,并为图像、视频和三维数据的识别开发了各自的独立架构。相反,本文中我们提出一种单一模型,在使用完全相同模型参数的情况下,擅长对图像、视频和单视图三维数据进行分类。我们的“Omnivore”模型利用了基于 transformer 的架构的灵活性,并在来自不同模态的分类任务上联合训练。Omnivore 训练简单,使用现成的标准数据集,并且性能与同等规模的模态专用模型相当或更好。单个 Omnivore 模型在 ImageNet 上取得 86.0%、在 Kinetics 上取得 84.1%、在 SUN RGB-D 上取得 67.1%。经过微调后,我们的模型在多种视觉任务上优于先前工作,并能跨模态泛化。Omnivore 的共享视觉表征天然支持跨模态识别,而无需模态间的对应关系。我们希望我们的结果能激励研究者将视觉模态放在一起建模。
引用
@article{arxiv.2201.08377,
title = {Omnivore: A Single Model for Many Visual Modalities},
author = {Rohit Girdhar and Mannat Singh and Nikhila Ravi and Laurens van der Maaten and Armand Joulin and Ishan Misra},
journal= {arXiv preprint arXiv:2201.08377},
year = {2022}
}
备注
Accepted at CVPR 2022 (Oral Presentation)