中文

定义视觉新纪元的基础模型:综述与展望

计算机视觉与模式识别 2023-07-27 v1 人工智能

摘要

用于观察并推理视觉场景组合性质的视觉系统是研究我们世界的基础。物体与其位置、歧义及真实世界环境中的变化之间的复杂关系可更好地用人类语言描述,其天然受语法规则及其他模态(如音频和深度)支配。学习以弥合此类模态差距并结合大规模训练数据的模型促进了上下文推理、泛化及测试时的提示能力。这些模型被称为基础模型(foundational models)。此类模型的输出可通过人类提供的提示修改而无需重新训练,例如,通过提供边界框分割特定物体、通过询问有关图像或视频场景的问题进行交互式对话,或通过语言指令操纵机器人行为。在本综述中,我们对这类新兴基础模型进行了全面回顾,包括用于组合不同模态(视觉、文本、音频等)的典型架构设计、训练目标(对比、生成)、预训练数据集、微调机制以及常见的提示模式:文本、视觉和异构。我们讨论了计算机视觉中基础模型的开放挑战和研究方向,包括其评估与基准测试的困难、真实世界理解中的差距、上下文理解的局限性、偏差、对抗攻击的脆弱性及可解释性问题。我们回顾了该领域的近期进展,系统且全面地涵盖了基础模型广泛的适用范围。本工作中研究的基础模型综合列表可在 \url{https://github.com/awaisrauf/Awesome-CV-Foundational-Models} 获取。

关键词

引用

@article{arxiv.2307.13721,
  title  = {Foundational Models Defining a New Era in Vision: A Survey and Outlook},
  author = {Muhammad Awais and Muzammal Naseer and Salman Khan and Rao Muhammad Anwer and Hisham Cholakkal and Mubarak Shah and Ming-Hsuan Yang and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2307.13721},
  year   = {2023}
}

备注

Project page: https://github.com/awaisrauf/Awesome-CV-Foundational-Models