通过混合指令生成构建高质量文本丰富图像指令调优数据集
计算机视觉与模式识别
2024-12-24 v1 计算与语言
摘要
大型多模态模型因训练数据不足仍在文本丰富图像方面表现不佳。自监督指令生成(Self-Instruct)提供了无需标注的方式生成指令数据,但其质量较差,由于多模态对齐仍是即使在最大模型面前也难以克服的难题。本文提出了 LLaVAR-2,通过人工标注员与大语言模型之间的混合指令生成来增强文本丰富图像的多模态对齐。具体而言,首先由人工标注员提供详细的图像描述,然后将这些标注作为量身定制的文本提示输入 GPT-4o 来构建数据集。我们还实现了若干机制以过滤低质量数据,最终构建的数据集包含 424k 对高质量指令。实证结果表明,在本数据集上微调的模型相对于使用自监督指令数据训练的模型表现显著提升。
引用
@article{arxiv.2412.16364,
title = {A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation},
author = {Shijie Zhou and Ruiyi Zhang and Yufan Zhou and Changyou Chen},
journal= {arXiv preprint arXiv:2412.16364},
year = {2024}
}
备注
COLING 2025