中文

面向通用多模态模型的视觉指令微调:综述

计算机视觉与模式识别 2023-12-29 v1

摘要

传统计算机视觉通常通过专用模型独立解决每个单一任务,任务指令隐含在模型架构设计中,这导致了两个局限性:(1) 产生任务特定模型,需要多个模型处理不同任务,限制了不同任务间的潜在协同作用;(2) 导致预定义且固定的模型接口,在遵循用户任务指令方面交互性和适应性有限。为解决这些问题,视觉指令微调(VIT)近年来被深入研究,它通过将语言作为任务指令微调大型视觉模型,旨在从由语言指令描述的广泛视觉任务中学习一个通用多模态模型,该模型可以遵循任意指令,从而解决用户指定的任意任务。本文旨在对视觉指令微调进行系统综述,涵盖:(1) 介绍计算机视觉任务范式及VIT发展的背景;(2) VIT的基础,介绍常用网络架构、视觉指令微调框架与目标、评估设置与任务;(3) 视觉指令微调与评估中常用的数据集;(4) 现有VIT方法的综述,根据所研究的视觉任务和方法设计进行分类,并突出其主要贡献、优势和不足;(5) 在各种指令遵循基准上对VIT方法进行比较和讨论;(6) 视觉指令微调研究中的若干挑战、开放方向及可能的未来工作。

关键词

引用

@article{arxiv.2312.16602,
  title  = {Visual Instruction Tuning towards General-Purpose Multimodal Model: A Survey},
  author = {Jiaxing Huang and Jingyi Zhang and Kai Jiang and Han Qiu and Shijian Lu},
  journal= {arXiv preprint arXiv:2312.16602},
  year   = {2023}
}