中文

COSMO: 对比流线型多模态模型与交错预训练

计算机视觉与模式识别 2024-01-02 v1

摘要

在视觉-语言预训练的演进中,从短文本理解扩展到长文本上下文是关键的。最近的基于自回归的视觉-语言模型如\cite{flamingo, palme},利用大语言模型的长上下文能力,在少样本文本生成任务中表现出色,但在对齐任务中面临挑战。为解决这一差距,我们将对比损失引入文本生成模型,提出对比流线型多模态框架(\ModelName),策略性地将语言模型划分为专用的单模态文本处理和熟练的多模态数据处理组件。\ModelName,我们的统一框架,融合了单模态和多模态元素,增强了涉及文本和视觉数据的任务性能,同时显著减少了可学习参数。然而,这些模型需要大量的长文本数据集,但高质量的长文本视频数据集仍然有限。为弥补这一差距,本工作引入\VideoDatasetName,一个首创的交错视频-文本数据集,具有全面的描述,标志着重要一步。展示其影响,我们说明\VideoDatasetName如何增强模型在图像-文本任务中的性能。使用34%的可学习参数和72%的可用数据,我们的模型表现出对OpenFlamingo的显著优势。例如,在4-shot flickr描述任务中,性能从57.2%显著提升到65.%。\ModelName和\VideoDatasetName的贡献通过14个不同的下游数据集(包括图像-文本和视频-文本任务)的显著性能提升得到强调。

关键词

引用

@article{arxiv.2401.00849,
  title  = {COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training},
  author = {Alex Jinpeng Wang and Linjie Li and Kevin Qinghong Lin and Jianfeng Wang and Kevin Lin and Zhengyuan Yang and Lijuan Wang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2401.00849},
  year   = {2024}
}

备注

16 pages; Website: http://fingerrec.github.io/cosmo