中文

视觉与语言预训练

计算与语言 2024-12-12 v3

摘要

随着图像-文本对数据的激增以及视觉与语言(V&L)任务的多样性,学者们在该研究领域引入了大量深度学习模型。此外,近年来,迁移学习在计算机视觉的任务(如图像分类、目标检测等)和自然语言处理(如问答、机器翻译等)中也取得了巨大成功。秉承迁移学习的精神,V&L 的研究工作设计了多种在大规模数据集上的预训练技术,以提升下游任务的性能。本文旨在对当代 V&L 预训练模型进行全面梳理。特别地,我们对预训练方法进行分类和阐述,并总结最先进的视觉与语言预训练模型。此外,我们提供了训练数据集与下游任务的列表,以进一步厘清对 V&L 预训练的视角。最后,我们决定更进一步讨论未来研究的若干方向。

关键词

引用

@article{arxiv.2207.01772,
  title  = {Vision-and-Language Pretraining},
  author = {Thong Nguyen and Cong-Duy Nguyen and Xiaobao Wu and See-Kiong Ng and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2207.01772},
  year   = {2024}
}

备注

The content of the paper has been outdated. I would like to rewrite a new version with completely new information.