OmniVec:通过跨模态共享学习鲁棒表征
计算机视觉与模式识别
2023-11-13 v1 机器学习
摘要
基于学习的方法中的大多数研究都致力于为特定任务设计和训练网络。然而,许多跨模态的基于学习的任务存在共性,并有可能在一个联合框架中加以解决。我们提出了一个朝该方向的方法,以统一架构学习多种模态中的多个任务。所提出的网络由任务特定的编码器、中间公共主干以及任务特定的预测头组成。我们首先通过自监督掩码训练对其进行预训练,随后对不同任务进行顺序训练。我们在所有主要模态(如视觉、音频、文本和3D)上训练该网络,并在22个多样且具有挑战性的公开基准上报告结果。我们通过实验证明,使用联合网络进行跨模态训练可带来有意义的信息共享,这使我们能够在大多数基准上取得最先进(state-of-the-art)的结果。我们还展示了训练后的网络在跨模态任务以及未见数据集和任务上的泛化能力。
引用
@article{arxiv.2311.05709,
title = {OmniVec: Learning robust representations with cross modal sharing},
author = {Siddharth Srivastava and Gaurav Sharma},
journal= {arXiv preprint arXiv:2311.05709},
year = {2023}
}
备注
Accepted to WACV 2024