FlagEvalMM:一个用于全面多模态模型评估的灵活框架
计算机视觉与模式识别
2025-07-30 v3 人工智能
计算与语言
摘要
我们提出了FlagEvalMM,一个开源的评估框架,旨在全面评估多模态模型在多样化的视觉-语言理解和生成任务上的表现,如视觉问答、文本到图像/视频生成以及图像-文本检索。我们通过独立的评估服务将模型推理与评估解耦,从而实现灵活的资源分配以及新任务和新模型的无缝集成。此外,FlagEvalMM利用先进的推理加速工具(如vLLM、SGLang)和异步数据加载来显著提升评估效率。大量实验表明,FlagEvalMM提供了对模型优势与局限的准确且高效的洞察,使其成为推进多模态研究的宝贵工具。该框架在https://github.com/flageval-baai/FlagEvalMM上公开可访问。
引用
@article{arxiv.2506.09081,
title = {FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation},
author = {Zheqi He and Yesheng Liu and Jing-shu Zheng and Xuejing Li and Jin-Ge Yao and Bowen Qin and Richeng Xuan and Xi Yang},
journal= {arXiv preprint arXiv:2506.09081},
year = {2025}
}
备注
Accepted by ACL 2025 Demo