MANTIS:交错多图像指令微调
计算机视觉与模式识别
2024-11-18 v3 人工智能
计算与语言
摘要
大型多模态模型在单图像视觉语言任务中展现了出色的效果。然而,它们解决多图像视觉语言任务的能力仍有待提升。现有的 LMM(如 OpenFlamingo、Emu2 和 Idefics)通过在数亿网络噪声交错图文数据上进行预训练来获得多图像能力,这既不高效也不有效。本文旨在通过学术级资源下的指令微调构建强大的多图像 LMM。因此,我们精心构建了包含 721K 多图像指令数据的 Mantis-Instruct,用于训练一系列 Mantis 模型。指令微调赋予 Mantis 不同的多图像技能,如共指、比较、推理和时序理解。我们在 8 个多图像基准和 6 个单图像基准上评估 Mantis。Mantis-Idefics2 在所有多图像基准上均取得了 SoTA 结果,并以平均 13 个绝对分的优势击败了最强的多图像基线 Idefics2-8B。值得注意的是,Idefics2-8B 在 140M 交错多图像数据上进行了预训练,其规模比 Mantis-Instruct 大 200 倍。我们观察到 Mantis 在保留内和保留外基准上表现相当,这表明了其泛化能力。我们进一步在单图像基准上评估 Mantis,结果表明 Mantis 也保持了与 CogVLM 和 Emu2 相当的强大单图像性能。我们的结果表明,多图像能力不一定要通过大规模预训练获得,而是可以通过低成本的指令微调获得。Mantis 的训练和评估为未来提升 LMM 多图像能力的工作铺平了道路。
引用
@article{arxiv.2405.01483,
title = {MANTIS: Interleaved Multi-Image Instruction Tuning},
author = {Dongfu Jiang and Xuan He and Huaye Zeng and Cong Wei and Max Ku and Qian Liu and Wenhu Chen},
journal= {arXiv preprint arXiv:2405.01483},
year = {2024}
}
备注
13 pages, 3 figures, 13 tables