中文

MultiMAE:多模态多任务掩码自编码器

计算机视觉与模式识别 2022-04-05 v1 机器学习

摘要

我们提出一种称为多模态多任务掩码自编码器(MultiMAE)的预训练策略。它与标准掩码自编码在两个关键方面不同:I)它可选择地接受除 RGB 图像外的额外信息模态作为输入(即“多模态”),II)其训练目标相应地包括预测除 RGB 图像外的多个输出(即“多任务”)。我们利用掩码(跨图像块和输入模态)使 MultiMAE 的训练可行,并确保网络确实学习到跨模态预测编码。我们表明该预训练策略带来了一种灵活、简单且高效的框架,并改善了对下游任务的迁移结果。特别地,当除 RGB 图像外的额外信息可用或除 RGB 外无任何信息可用时,同一预训练网络均可灵活使用——在所有配置下均取得与基线相当或显著更好的结果。为避免需要具有多模态和多任务的数据集,我们完全使用伪标签训练 MultiMAE,这使该框架广泛适用于任何 RGB 数据集。实验在多个迁移任务(图像分类、语义分割、深度估计)和数据集(ImageNet、ADE20K、Taskonomy、Hypersim、NYUv2)上进行。结果显示了模型在跨模态/任务预测编码与迁移方面令人惊讶的出色能力。

关键词

引用

@article{arxiv.2204.01678,
  title  = {MultiMAE: Multi-modal Multi-task Masked Autoencoders},
  author = {Roman Bachmann and David Mizrahi and Andrei Atanov and Amir Zamir},
  journal= {arXiv preprint arXiv:2204.01678},
  year   = {2022}
}

备注

Project page at https://multimae.epfl.ch