4M:大规模多模态掩码建模
计算机视觉与模式识别
2023-12-12 v1 人工智能
机器学习
摘要
当前用于视觉的机器学习模型通常高度专业化,局限于单一模态和任务。相比之下,最近的大型语言模型展现出广泛的能力,暗示了计算机视觉领域同样存在多功能模型的可能性。在本文中,我们朝这个方向迈出了一步,提出了一种名为4M的多模态训练方案。该方案包括使用掩码建模目标,在广泛的输入/输出模态(包括文本、图像、几何和语义模态,以及神经网络特征图)上训练一个统一的Transformer编码器-解码器。4M通过将所有模态的表示空间映射到离散令牌,并对一小部分随机选择的令牌执行多模态掩码建模,从而实现可扩展性。4M产生的模型展现出几项关键能力:(1)它们可以直接执行多种视觉任务;(2)它们在针对未见过的下游任务或新输入模态进行微调时表现出色;(3)它们可以作为一个生成模型,以任意模态为条件,从而以卓越的灵活性实现多种富有表现力的多模态编辑能力。通过实验分析,我们展示了4M在训练用于视觉任务的通用且可扩展的基础模型方面的潜力,为视觉及其他领域的多模态学习进一步探索奠定了基础。
引用
@article{arxiv.2312.06647,
title = {4M: Massively Multimodal Masked Modeling},
author = {David Mizrahi and Roman Bachmann and Oğuzhan Fatih Kar and Teresa Yeo and Mingfei Gao and Afshin Dehghan and Amir Zamir},
journal= {arXiv preprint arXiv:2312.06647},
year = {2023}
}
备注
NeurIPS 2023 Spotlight. Project page at https://4m.epfl.ch/