中文

MaMMUT:一种用于多模态任务联合学习的简单架构

计算机视觉与模式识别 2023-08-10 v3 计算与语言 机器学习

摘要

语言模型的发展已从编码器-解码器结构转向仅解码器设计。此外,我们观察到两种最流行的多模态任务——生成式任务与对比式任务——难以在同一架构中兼顾,且还需针对下游任务进行适配。我们提出了一种用仅解码器模型训练多模态任务的新范式,其在联合学习这些异质视觉-语言任务时出奇地有效。这是通过一个名为 MaMMUT 的简单模型实现的。它由一个视觉编码器和一个文本解码器组成,并能够通过一种新颖的文本解码器两遍方法兼顾对比学习与生成式学习。我们证明,这些不同目标的联合学习是简单、有效的,并最大化了模型在这些任务间的权重共享。此外,同一架构可直截了当地扩展至开放词汇目标检测与视频-语言任务。该模型处理了多样化的任务,而容量却较为适中。我们的模型在图文与文图检索、视频问答以及开放词汇检测任务上达到了 SOTA,优于规模更大且训练更充分的基础模型。在 VQA 与视频描述任务上,它展现出极具竞争力的结果,尤其考虑到其容量。消融实验证实了我们所提方法的灵活性与优势。

关键词

引用

@article{arxiv.2303.16839,
  title  = {MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks},
  author = {Weicheng Kuo and AJ Piergiovanni and Dahun Kim and Xiyang Luo and Ben Caine and Wei Li and Abhijit Ogale and Luowei Zhou and Andrew Dai and Zhifeng Chen and Claire Cui and Anelia Angelova},
  journal= {arXiv preprint arXiv:2303.16839},
  year   = {2023}
}

备注

Published in Transactions on Machine Learning Research ( https://jmlr.org/tmlr/ ). 18 pages, 4 figures