中文

数据-Juicer 沙盒:面向多模态数据-模型协同开发的反馈驱动套件

人工智能 2025-06-05 v3 计算机视觉与模式识别 机器学习

摘要

多模态大模型的出现推动了人工智能领域的发展,带来了前所未有的性能提升和功能增强。然而,这些模型的优化仍面临挑战,因为过去模型导向和数据导向的开发路径往往是孤立的,导致结果次优和资源利用效率低下。为此,我们提出了面向集成数据-模型协同开发的全新沙盒套件。该沙盒提供了反馈驱动的实验平台,使数据和模型的成本效益迭代和引导性优化成为可能。我们提出的“探针-分析-精炼”工作流程,通过在CLIP进行图像-文本预训练、LLaVA类模型进行图像到文本生成以及基于DiT模型进行文本到视频生成等多模态任务上的实际案例验证,展现出可迁移且显著的性能提升,如获VBench排行榜第一。该套件经过一系列超过100个实验的全面验证,证明了其可用性和可扩展性,同时也揭示了数据质量、多样性、模型行为与计算成本之间相互作用的深刻见解。所有代码、数据集和模型均开源,以促进未来研究和应用,这些研究和应用之前由于缺乏专门的协同开发基础设施,往往难以实现。

关键词

引用

@article{arxiv.2407.11784,
  title  = {Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development},
  author = {Daoyuan Chen and Haibin Wang and Yilun Huang and Ce Ge and Yaliang Li and Bolin Ding and Jingren Zhou},
  journal= {arXiv preprint arXiv:2407.11784},
  year   = {2025}
}

备注

Accepted by ICML 2025 (Spotlight). 33 pages, 16 tables, 14 figures