中文

面向视觉微调的游戏化众包高质量数据

人工智能 2024-10-10 v2 计算机视觉与模式识别

摘要

本文引入 Gamified Adversarial Prompting(GAP),一个用于大型多模态模型视觉指令调优的众包高质�数据的框架。GAP 将数据收集过程转化为富有吸引力的游戏,激励玩家提供针对模型知识薄弱环节的精细且具挑战性的问题和答案。我们的贡献包括:(1)捕获来自人类的问题-答案对,以直接针对模型知识 weakness;(2)评估和奖励玩家的方法,成功激励他们提供高质量提交物;(3)一个可扩展且游戏化的平台,仅用数周即从 5 万多名参与者中收集此类数据。我们实现的 GAP 显著提高了小型多模态模型 MiniCPM-Llama3-V-2.5-8B 的准确率,其 GPT 评分从 0.147 提升至 0.477,接近 GPT-4V 的基准。更重要的是,我们证明了使用 MiniCPM-Llama3-V-2.5-8B 生成的数据也能提升其在其他基准测试中的性能,并显示出跨模型的优势。具体而言,同一数据显著提高了 QWEN2-VL-2B 和 QWEN2-VL-7B 在相同多个基准测试上的性能。

关键词

引用

@article{arxiv.2410.04038,
  title  = {Gamified crowd-sourcing of high-quality data for visual fine-tuning},
  author = {Shashank Yadav and Rohan Tomar and Garvit Jain and Chirag Ahooja and Shubham Chaudhary and Charles Elkan},
  journal= {arXiv preprint arXiv:2410.04038},
  year   = {2024}
}