UniEval:面向统一多模态理解与生成的统一整体评估框架
计算机视觉与模式识别
2025-05-16 v1 人工智能
摘要
统一多模态理解与生成模型因其在提升指令跟随能力的同时最小化模型冗余性而正迅速受到关注。然而,缺乏针对此类模型的统一评估框架,导致无法进行优雅、简化的整体评估。现有模型在多个任务特定基准上进行评估,但存在明显局限性,如缺乏整体结果、依赖额外评估模型、依赖大量标注图像、基准多样性不足以及指标对指令跟随评估的容量有限。为此,我们引入UniEval——首个无需额外模型、图像或标注的评估框架,从而简化并统一评估流程。该框架包含整体基准UniBench(支持统一模型和视觉生成模型),以及对应的UniScore评分指标。UniBench包含81个细粒度标签,确保高多样性。实验结果表明,UniBench比现有基准更具挑战性,UniScore与人类评估高度一致,超越当前指标。此外,我们广泛评估了最先进的统一模型和视觉生成模型,揭示了Universal模型的独特价值。
引用
@article{arxiv.2505.10483,
title = {UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation},
author = {Yi Li and Haonan Wang and Qixiang Zhang and Boyu Xiao and Chenchang Hu and Hualiang Wang and Xiaomeng Li},
journal= {arXiv preprint arXiv:2505.10483},
year = {2025}
}
备注
UniEval is the first evaluation framework designed for unified multimodal models, including a holistic benchmark UniBench and the UniScore metric