中文

FIRE:面向多模态模型的反馈集成与细化评估数据集

计算机视觉与模式识别 2024-12-03 v2

摘要

视觉语言模型(VLM)在多样化应用中取得了显著进展,成为流行的研究方向。本文构建了FIRE,一个反馈细化数据集,包含110万个多轮对话,源自27个数据集,使VLMs能够在跨任务中基于用户反馈自主细化其响应。为扩大数据规模,FIRE包含两个组件:FIRE-100K和FIRE-1M,其中FIRE-100K由GPT-4V生成,FIRE-1M通过在FIRE-100K上训练的模型自由生成。随后,我们构建了FIRE-Bench,用于全面评估VLMs的反馈细化能力,包含11K个反馈细化对话作为测试数据、两个评估设置以及一个为VLMs提供反馈的模型。我们开发了FIRE-LLaVA模型,通过在FIRE-100K和FIRE-1M上微调LLaVA,显示出在FIRE-Bench上的显著反馈细化能力, outperform未训练的VLMs 50%,更高效地实现用户与代理之间的交互,凸显了FIRE数据集的重要性。

关键词

引用

@article{arxiv.2407.11522,
  title  = {FIRE: A Dataset for Feedback Integration and Refinement Evaluation of Multimodal Models},
  author = {Pengxiang Li and Zhi Gao and Bofei Zhang and Tao Yuan and Yuwei Wu and Mehrtash Harandi and Yunde Jia and Song-Chun Zhu and Qing Li},
  journal= {arXiv preprint arXiv:2407.11522},
  year   = {2024}
}

备注

NeurIPS 2024 Dataset & Benchmark Track