中文

精选精华:通过代理协作的视觉中心数据选择

计算与语言 2025-02-28 v1

摘要

为提高多模态大语言模型(MLLMs)处理图像和复杂指令的能力,研究者主要筛选大规模视觉指令调优数据集,这些数据要么来自现有的视觉任务,要么是使用 LLM 和图像描述人工生成的。然而,这些方法常常存在严重缺陷,包括指令-图像对错位以及低质量图像。此类问题会阻碍训练效率,并限制性能提升,因为模型会在噪声或无关数据上浪费资源,获得的整体能力提升有限。为此,我们提出一种基于代理协作的视觉中心选择方法(ViSA),以图像质量评估和图像-指令相关性评估为核心。具体而言,我们的方法包括:1)通过视觉代理协作进行图像信息量化,以选择信息丰富的图像;2)进行视觉中心的指令质量评估,以选择与高质量图像相关的高质量指令数据。最后,我们重新组织了来自大型开源数据集的8万条指令数据。广泛的实验表明,ViSA 在七个基准测试中超越或相当于当前最先进的模型,仅使用原始数据的2.5%,凸显了数据选择方法的高效性。此外,我们进行了消融研究,以验证方法各组件的有效性。代码已公开于https://github.com/HITsz-TMG/ViSA。

关键词

引用

@article{arxiv.2502.19917,
  title  = {Picking the Cream of the Crop: Visual-Centric Data Selection with Collaborative Agents},
  author = {Zhenyu Liu and Yunxin Li and Baotian Hu and Wenhan Luo and Yaowei Wang and Min Zhang},
  journal= {arXiv preprint arXiv:2502.19917},
  year   = {2025}
}

备注

15 pages, 7 figures