中文

视觉语言任务如何受益于大型预训练模型:一项综述

计算机视觉与模式识别 2024-12-12 v1 计算与语言 机器学习

摘要

视觉语言任务(如视觉描述生成、视觉问答和视觉常识推理)的探索是人工智能领域的重要方向,并持续吸引研究界的关注。尽管整体性能有所提升,但视觉语言任务中仍存在经典挑战,阻碍了该领域的发展。近年来,预训练模型的兴起推动了视觉语言任务的研究。得益于大规模训练数据和模型参数,预训练模型在众多下游任务中展现出优异性能。受预训练模型强大能力的启发,新的范式应运而生以解决这些经典挑战。此类方法已成为当前研究的主流,受到越来越多的关注和快速的进展。本文对视觉语言任务如何从预训练模型中受益进行了全面综述。首先,我们回顾了视觉语言任务中的若干主要挑战,并讨论了预训练时代之前先前解决方案的局限性。其次,我们总结了利用预训练模型应对视觉语言任务挑战的最新进展。最后,我们分析了预训练模型固有局限性所带来的潜在风险,并讨论了可能的解决方案,试图提供未来研究方向。

关键词

引用

@article{arxiv.2412.08158,
  title  = {How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey},
  author = {Yayun Qi and Hongxi Li and Yiqi Song and Xinxiao Wu and Jiebo Luo},
  journal= {arXiv preprint arXiv:2412.08158},
  year   = {2024}
}

备注

Under Review