中文

视觉-语言预训练:基础、近期进展与未来趋势

计算机视觉与模式识别 2022-10-18 v1 计算与语言

摘要

本文综述了过去几年中为多模态智能开发的视觉-语言预训练(VLP)方法。我们将这些方法分为三类:(ii)用于图像-文本任务的 VLP,如图像描述、图像-文本检索、视觉问答和视觉定位;(iiii)用于核心计算机视觉任务的 VLP,如(开放集)图像分类、目标检测和分割;以及(iiiiii)用于视频-文本任务的 VLP,如视频描述、视频-文本检索和视频问答。对于每个类别,我们全面回顾了最先进的方法,并以特定系统和模型为案例研究,讨论了已取得的进展和仍面临的挑战。此外,对于每个类别,我们讨论了研究界正积极探索的前沿主题,例如大型基础模型、统一建模、上下文少样本学习、知识、鲁棒性以及真实场景下的计算机视觉等。

关键词

引用

@article{arxiv.2210.09263,
  title  = {Vision-Language Pre-training: Basics, Recent Advances, and Future Trends},
  author = {Zhe Gan and Linjie Li and Chunyuan Li and Lijuan Wang and Zicheng Liu and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2210.09263},
  year   = {2022}
}

备注

A survey paper/book on Vision-Language Pre-training (102 pages)