LLaVAR:面向富含文本图像理解的增强视觉指令微调
计算机视觉与模式识别
2024-02-06 v2 计算与语言
摘要
指令微调释放了大语言模型(LLM)与人类交互的卓越能力。此外,近期的指令跟随数据集将图像作为视觉输入,收集基于图像指令的回复。然而,视觉指令微调模型难以很好地理解图像中的文本细节。本文利用富含文本的图像(如电影海报、书籍封面等)增强了当前的视觉指令微调流程。具体而言,我们首先使用公开的 OCR 工具从 LAION 数据集中收集 422K 张富含文本图像的结果。此外,我们用文本-only 的 GPT-4 结合识别出的文本与图像描述生成 16K 段对话,每段包含针对富含文本图像的问答对。通过将我们收集的数据与先前的多模态指令跟随数据相结合,我们的模型 LLaVAR 大幅提升了 LLaVA 模型在基于文本的 VQA 数据集上的能力(准确率提升高达 20%),同时在 ScienceQA 上达到 91.42% 的准确率。基于 GPT-4 的指令跟随评估也展示了我们的模型在自然图像与富含文本图像上的改进。通过定性分析,LLaVAR 基于结合文本与图像的最新现实世界在线内容,展现出与人类进行有前景的交互(如推理、写作与阐述)技能。我们在 https://llavar.github.io/ 公开我们的代码/数据/模型。
引用
@article{arxiv.2306.17107,
title = {LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding},
author = {Yanzhe Zhang and Ruiyi Zhang and Jiuxiang Gu and Yufan Zhou and Nedim Lipka and Diyi Yang and Tong Sun},
journal= {arXiv preprint arXiv:2306.17107},
year = {2024}
}
备注
Preprint