Instructify:揭秘元数据到视觉指令微调数据的转换
计算机视觉与模式识别
2025-05-26 v1
摘要
视觉指令微调(VisIT)数据通常以人机对话的形式呈现,图像穿插在人类对话轮次之间,是目前将强 LLM 对齐以理解视觉输入、将其转换为强 LMM 的最广泛载体。虽然存在许多 VisIT 数据集,但大多数都是由不同团队独立使用临时开发的技术构建的。它们通常文档不完善、缺乏可复现代码,并依赖付费的闭源模型 API(如 GPT-4、Gemini 或 Claude)将图像元数据(标签)转换为 VisIT 指令。这导致了高昂的成本,并使扩展规模、提升质量或为新数据集生成 VisIT 数据变得困难。在本工作中,我们解决了这些挑战,并提出了一种开放且统一的方案和方法 \textbf{\method},用于利用开源 LLM 将可用元数据转换为 VisIT 指令。我们的多阶段 \method 包含一个高效框架,用于元数据分组、质量控制、数据与提示组织以及对话采样。我们证明,当应用于相同的图像数据和元数据源时,我们的方法可以复现或增强现有 VisIT 数据集的数据质量,使用开源模型(如 Gemma 2 27B 和 LLaMa 3.1 70B)相比 GPT-4 生成的 VisIT 指令平均提升约 3\%,在个别基准上最高提升 12\%。此外,我们的方法通过提升 resulting LMM 在广泛基准上的性能,实现了有效的性能扩展——既在数量上也在质量上。我们还分析了多种因素的影响,包括对话格式、基础模型选择和重采样策略。我们的代码支持复现同等或更高质量的 VisIT 数据集,并支持未来为小众领域进行元数据到 VisIT 数据的转换,已发布于 https://github.com/jacob-hansen/Instructify。
引用
@article{arxiv.2505.18115,
title = {Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion},
author = {Jacob Hansen and Wei Lin and Junmo Kang and Muhammad Jehanzeb Mirza and Hongyin Luo and Rogerio Feris and Alan Ritter and James Glass and Leonid Karlinsky},
journal= {arXiv preprint arXiv:2505.18115},
year = {2025}
}