MultiMAE:多模态多任务掩码自编码器
计算机视觉与模式识别
2022-04-05 v1 机器学习
摘要
我们提出一种称为多模态多任务掩码自编码器(MultiMAE)的预训练策略。它与标准掩码自编码在两个关键方面不同:I)它可选择地接受除 RGB 图像外的额外信息模态作为输入(即“多模态”),II)其训练目标相应地包括预测除 RGB 图像外的多个输出(即“多任务”)。我们利用掩码(跨图像块和输入模态)使 MultiMAE 的训练可行,并确保网络确实学习到跨模态预测编码。我们表明该预训练策略带来了一种灵活、简单且高效的框架,并改善了对下游任务的迁移结果。特别地,当除 RGB 图像外的额外信息可用或除 RGB 外无任何信息可用时,同一预训练网络均可灵活使用——在所有配置下均取得与基线相当或显著更好的结果。为避免需要具有多模态和多任务的数据集,我们完全使用伪标签训练 MultiMAE,这使该框架广泛适用于任何 RGB 数据集。实验在多个迁移任务(图像分类、语义分割、深度估计)和数据集(ImageNet、ADE20K、Taskonomy、Hypersim、NYUv2)上进行。结果显示了模型在跨模态/任务预测编码与迁移方面令人惊讶的出色能力。
引用
@article{arxiv.2204.01678,
title = {MultiMAE: Multi-modal Multi-task Masked Autoencoders},
author = {Roman Bachmann and David Mizrahi and Andrei Atanov and Amir Zamir},
journal= {arXiv preprint arXiv:2204.01678},
year = {2022}
}
备注
Project page at https://multimae.epfl.ch