中文

OmniVec2 -- 一种用于大规模多模态和多任务学习的新型 Transformer 网络

计算机视觉与模式识别 2025-07-21 v1 人工智能

摘要

我们提出了一种新型多模态多任务网络及其相关训练算法。该方法能够处理约 12 种不同模态的数据,包括图像、视频、音频、文本、深度、点云、时间序列、表格、图、X 光、红外、IMU 和高光谱。我们的方法利用特定模态的标记化器、共享 Transformer 架构和跨注意力机制,将来自不同模态的数据投影到统一的嵌入空间。该方法通过在各模态中针对不同任务的模态特定任务头来解决多模态和多任务场景。我们提出了一种以迭代模态切换为初始化策略的预训练方法,以及一种在所有模态上进行完全联合训练与仅对两个模态进行训练之间进行权衡的训练算法。我们在 12 种模态的 25 个数据集上提供了全面评估,展示了最先进的性能,证明了该架构、预训练策略和所采用多任务训练的有效性。

关键词

引用

@article{arxiv.2507.13364,
  title  = {OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning},
  author = {Siddharth Srivastava and Gaurav Sharma},
  journal= {arXiv preprint arXiv:2507.13364},
  year   = {2025}
}