用于视觉-语言表示学习与检索的对比跨模态知识共享预训练
计算机视觉与模式识别
2022-07-11 v2 人工智能
摘要
近年来,跨模态预训练任务因其在检索、描述生成、问答等众多下游研究中的广泛应用而成为热点。然而,现有方法采用单流预训练模型来探索统一的视觉-语言表示以进行跨模态检索,容易遭遇计算爆炸问题。此外,尽管传统的双流结构相当高效,其仍缺乏关键的跨模态交互,导致性能低下。受这些挑战驱动,我们提出一种对比跨模态知识共享预训练(COOKIE)以获取联合的文本-图像表示。在结构上,COOKIE因可接受的时间消耗而采用传统双流结构。为克服上述双流结构的固有缺陷,我们精心设计了两个有效模块。具体而言,第一个模块是构建在视觉与文本编码器头部的权重共享Transformer,旨在语义对齐文本与图像。该设计使视觉与文本路径聚焦于相同语义。另一个模块是三个专门设计的对比学习,旨在不同模型间共享知识。共享的跨模态知识极大促进了单模态表示的研究,推动了单模态检索任务。在多模态匹配研究(包括跨模态检索、文本匹配和图像检索)上的大量实验结果表明了我们的预训练模型在计算效率和统计指标上的优越性。
引用
@article{arxiv.2207.00733,
title = {Contrastive Cross-Modal Knowledge Sharing Pre-training for Vision-Language Representation Learning and Retrieval},
author = {Keyu Wen and Zhenshan Tan and Qingrong Cheng and Cheng Chen and Xiaodong Gu},
journal= {arXiv preprint arXiv:2207.00733},
year = {2022}
}