中文

基于检索的知识增强视觉语言预训练

计算机视觉与模式识别 2023-08-08 v2 计算与语言 多媒体

摘要

随着大规模视觉和语言表示学习的最新进展,视觉语言预训练(VLP)模型在各种多模态下游任务上取得了显著的改进。尽管功能强大,但这些模型并未充分利用世界知识来发挥其优势。知识增强 VLP 的一个关键挑战是知识与多模态数据之间缺乏明确的联系。此外,并非图像/文本中存在的所有知识都是有用的,因此先前的方法通常难以有效地整合知识、视觉和文本信息。在本研究中,我们提出了 REtrieval-based knowledge Augmented Vision Language (REAVL),一种新颖的知识增强预训练框架,以解决上述问题。我们首次引入了一种知识感知的自监督学习方案,该方案能高效地建立知识与多模态数据之间的对应关系,并识别有用的知识,以改善视觉和文本模态之间对齐与交互的建模。通过自适应地将有用知识与视觉和文本信息相整合,REAVL 在基于知识的视觉语言理解和多模态实体链接任务上均取得了新的 SOTA 性能,同时在仅使用最优模型 0.2% 预训练数据的情况下,在通用视觉语言任务上也取得了具有竞争力的结果。我们的模型展示了强大的样本效率和有效的知识利用能力。

关键词

引用

@article{arxiv.2304.13923,
  title  = {Retrieval-based Knowledge Augmented Vision Language Pre-training},
  author = {Jiahua Rao and Zifei Shan and Longpo Liu and Yao Zhou and Yuedong Yang},
  journal= {arXiv preprint arXiv:2304.13923},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2210.09338 by other authors