中文

4M-21:面向数十种任务与模态的全能视觉模型

计算机视觉与模式识别 2024-06-17 v2 人工智能 机器学习

摘要

当前的多模态和多任务基础模型如4M或UnifiedIO已展现出色的性能,但在实际应用中,其接受多样化输入、执行多样化任务的开箱即用能力,受限于所训练的模态数量和任务数量(通常相当有限)。本文通过在大规模多模态数据集和文本语料上进行训练,将这些模型的能力扩展到数十种高度多样化的模态。具体包括训练多个语义和几何模态、来自最新领先模型如DINOv2和ImageBind的特征图、来自专家模型如SAM和4DHumans的伪标签,以及一系列新模态,这些新模态允许用户以 novel 方式与模型交互并引导生成,例如图像元数据或颜色调色板。在此过程中,关键步骤是对各种模态进行离散化标记化,无论这些模态是图像类、神经网络特征图、向量、结构化数据(如实例分割或人体姿态),或可表示为文本的数据。通过这种方式,我们扩展了多模态模型的开箱即用能力,特别展示了训练单个模型解决至少3倍于现有模型的任务/模态的可能性,且不会损失性能。这使得更精细可控的多模态生成能力成为可能,并允许我们研究在多样化数据和目标训练的统一模型中进行知识蒸馏的可能性。我们成功将训练规模扩展到三亿参数模型,运用数十种模态和不同数据集进行训练。 resulting models and training code are open sourced at 4m.epfl.ch。

关键词

引用

@article{arxiv.2406.09406,
  title  = {4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities},
  author = {Roman Bachmann and Oğuzhan Fatih Kar and David Mizrahi and Ali Garjani and Mingfei Gao and David Griffiths and Jiaming Hu and Afshin Dehghan and Amir Zamir},
  journal= {arXiv preprint arXiv:2406.09406},
  year   = {2024}
}

备注

Project page at 4m.epfl.ch