中文

检索增强的多模态语言建模

计算机视觉与模式识别 2023-06-07 v2 计算与语言 机器学习

摘要

近期的多模态模型如DALL-E和CM3在文本到图像和图像到文本生成方面取得了显著进展。然而,这些模型将所有习得的知识(例如埃菲尔铁塔的外观)存储在模型参数中,需要越来越大的模型和训练数据来捕捉更多知识。为了以更具可扩展性和模块化的方式整合知识,我们提出了一种检索增强的多模态模型,其使基础多模态模型(生成器)能够参考检索器从外部记忆(例如网络文档)中获取的相关文本与图像。具体而言,对于检索器,我们使用预训练的CLIP;对于生成器,我们在LAION数据集上训练了一个CM3 Transformer。我们所得的模型称为检索增强CM3(RA-CM3),是首个能够检索并生成文本与图像的多模态模型。我们表明RA-CM3在图像与描述生成任务上显著优于DALL-E和CM3等基线多模态模型(在MS-COCO上FID提升12,CIDEr提升17),同时训练所需计算量远少(小于DALL-E的30%)。此外,我们展示RA-CM3展现出诸如忠实图像生成和多模态上下文学习(例如基于示例的图像生成)等新能力。

关键词

引用

@article{arxiv.2211.12561,
  title  = {Retrieval-Augmented Multimodal Language Modeling},
  author = {Michihiro Yasunaga and Armen Aghajanyan and Weijia Shi and Rich James and Jure Leskovec and Percy Liang and Mike Lewis and Luke Zettlemoyer and Wen-tau Yih},
  journal= {arXiv preprint arXiv:2211.12561},
  year   = {2023}
}

备注

Published at ICML 2023. Blog post available at https://cs.stanford.edu/~myasu/blog/racm3/