中文

关于视觉-语言指令微调数据集的评估与精炼

计算机视觉与模式识别 2024-01-02 v2

摘要

多模态指令微调研究正兴起,近期已提出一系列用于评估这些模型的基准。本文不直接评估模型,而是尝试评估视觉-语言指令微调(VLIT)数据集。同时,我们探寻构建用于开发全能 VLIT 模型的数据集之道,相信这也有助于建立评估 VLIT 模型的 grounded 协议。针对仍属开放问题的 VLIT 数据集有效评估,我们提出调-交叉-评估范式:在一个数据集上微调,依次在其他数据集上评估。对每组单一微调-评估实验,我们定义元质量(MQ)为包括 BLEU、METEOR 与 ROUGE-L 在内的一组描述指标所得平均分,以量化某数据集或样本的质量。在此基础上,为评估数据集的完备性,我们发展了覆盖所有微调-评估组的数据库质量(DQ)。为构建完备数据集并开发面向实际应用的全能模型奠基,我们定义样本质量(SQ)以量化每个样本的多面质量。大量实验验证了所提评估范式的合理性。基于整体评估,我们通过从各数据集中收集 SQ 较高的样本构建了一个新数据集 REVO-LION(REfining VisiOn-Language InstructiOn tuNing)。值得注意的是,即便仅用完整数据的一半,在 REVO-LION 上训练的模型也能达到简单叠加所有 VLIT 数据集的性能。此外,REVO-LION 不仅助力强大模型开发,还包含一个评估集,旨在作为该领域未来研究的便捷基准。

关键词

引用

@article{arxiv.2310.06594,
  title  = {On the Evaluation and Refinement of Vision-Language Instruction Tuning Datasets},
  author = {Ning Liao and Shaofeng Zhang and Renqiu Xia and Min Cao and Yu Qiao and Junchi Yan},
  journal= {arXiv preprint arXiv:2310.06594},
  year   = {2024}
}