多模态掩码自编码器学习可迁移表征
计算机视觉与模式识别
2022-10-24 v3
摘要
构建可扩展模型以从多样的多模态数据中学习仍是一项开放挑战。对于视觉-语言数据,主流方法基于对比学习目标,为每个模态训练单独的编码器。尽管有效,对比学习方法会引入依赖于所使用数据增强的采样偏差,从而可能降低下游任务性能。此外,这些方法局限于成对的图文数据,无法利用广泛可用的非配对数据。本文中,我们探究仅通过掩码 token 预测训练、不使用模态特定编码器或对比学习的大规模多模态模型是否能学习用于下游任务的可迁移表征。我们提出了一种简单且可扩展的网络架构——多模态掩码自编码器(M3AE),它通过掩码 token 预测为视觉与语言数据学习统一编码器。我们提供了在大规模图文数据集上训练的 M3AE 的实证研究,发现 M3AE 能够学习可泛化且良好迁移至下游任务的表征。令人惊讶的是,我们发现 M3AE 受益于更高的文本掩码率(50-90%),不同于 BERT 标准掩码率 15%,这是由于两种数据模态的联合训练。我们还提供定性分析表明所学表征融合了来自图像与语言的有意义信息。最后,我们展示了 M3AE 在更大模型规模与训练时间下的可扩展性,以及其在成对图文数据与非配对数据上训练的灵活性。
引用
@article{arxiv.2205.14204,
title = {Multimodal Masked Autoencoders Learn Transferable Representations},
author = {Xinyang Geng and Hao Liu and Lisa Lee and Dale Schuurmans and Sergey Levine and Pieter Abbeel},
journal= {arXiv preprint arXiv:2205.14204},
year = {2022}
}