比较可视化指令调优
计算机视觉与模式识别
2024-06-14 v1
摘要
比较两个图像中公共性与差异性(Commonalities and Differences, CaD)是人类基本能力之一,构成了高级视觉推理和解释的基础。它对于生成详细且上下文相关的描述、执行比较分析、异常检测以及基于视觉数据做出明智决策至关重要。然而,令人惊讶的是,针对这些基本概念的关注在当前最优秀的人类视觉智能模仿器——大型多模态模型(LMMs)方面几乎没有被关注。我们开发并贡献了一种新的两阶段方法CaD-VI,用于收集合成视觉指令,同时开发了一个包含34.9万张图像对的指令遵循数据集CaD-Inst,采用CaD-VI收集。我们的方法显著提升了LMMs在CaD识别能力,使相关任务的SOTA提升最高可达17.5%。这也与现有的仅包含差异指令的数据集互补,允许自动针对性地细化这些资源,使其在CaD调优中的有效性提升最高可达10%。此外,我们提出了一个包含7.5万个开放式问答的评估基准,用于评估LMMs的CaD理解能力。
引用
@article{arxiv.2406.09240,
title = {Comparison Visual Instruction Tuning},
author = {Wei Lin and Muhammad Jehanzeb Mirza and Sivan Doveh and Rogerio Feris and Raja Giryes and Sepp Hochreiter and Leonid Karlinsky},
journal= {arXiv preprint arXiv:2406.09240},
year = {2024}
}
备注
Project page: https://wlin-at.github.io/cad_vi ; Huggingface dataset repo: https://huggingface.co/datasets/wlin21at/CaD-Inst