VIGC:视觉指令生成与校正
计算机视觉与模式识别
2024-02-06 v3 人工智能
摘要
视觉编码器与大语言模型(LLMs)的融合推动了多模态大语言模型(MLLMs)近期的进展。然而,视觉语言任务高质量指令微调数据的稀缺仍是一项挑战。当前主流范式(如 LLaVA)依赖纯语言 GPT-4 生成数据,需要预标注的图像描述与检测边界框,存在对图像细节理解不足的问题。对此问题的实用解决方案是利用现有的多模态大语言模型(MLLMs)生成视觉语言任务的指令数据。但需注意,当前可用的 MLLMs 不如其 LLM 对应模型强大,往往产生不充分回复并生成错误信息。为解决当前问题,本文提出视觉指令生成与校正(VIGC)框架,使多模态大语言模型能够生成指令微调数据并实时逐步提升其质量。具体而言,视觉指令生成(VIG)引导视觉语言模型生成多样的指令微调数据。为保障生成质量,视觉指令校正(VIC)采用迭代更新机制纠正 VIG 所产数据中的任何不准确之处,有效降低幻觉风险。借助 VIGC 生成的多样高质量数据,我们微调主流模型并基于多项评估验证数据质量。实验结果表明,VIGC 不仅弥补了纯语言数据生成方法的不足,还有效提升了基准性能。模型、数据集与代码发布于 https://opendatalab.github.io/VIGC。
引用
@article{arxiv.2308.12714,
title = {VIGC: Visual Instruction Generation and Correction},
author = {Bin Wang and Fan Wu and Xiao Han and Jiahui Peng and Huaping Zhong and Pan Zhang and Xiaoyi Dong and Weijia Li and Wei Li and Jiaqi Wang and Conghui He},
journal= {arXiv preprint arXiv:2308.12714},
year = {2024}
}
备注
Accepted by AAAI 2024, Project Website: https://opendatalab.github.io/VIGC, Code and Pretrained Model: https://github.com/opendatalab/VIGC