FRABench 与 UFEval:统一的细粒度评估框架
人工智能
2025-09-30 v4 机器学习
摘要
评估多模态大语言模型(MLLM)的开放式输出已成为瓶颈,因为模型能力、任务多样性和模态快速扩展。现有的“MLLM 作为评判员”评估器虽有前景,但局限于特定任务和方面。在本文中,我们认为:一方面,基于方面之间的相互关联性,通过学习特定方面可以推广到未见方面;另一方面,联合学习以评估多个视觉方面和任务可能产生协同效应。为此,我们提出 UFEval——首个具备任务与方面通用性的统一细粒度评估器,用于四种评估任务:自然语言生成、图像理解、图像生成和交错文本与图像生成。然而,训练此类统一评估器受限于缺乏大规模、多模态且具备方面级别资源。为弥补这一空白,我们引入 FRABench——一个全面的细粒度评估数据集。具体而言:(1)我们首先构建了包含 112 个不同方面的层次化方面分类学,涵盖上述四种任务。(2)基于该分类学,我们创建了 FRABench,包含 60.4 万对样本,配有 32.5 万项评估标签,来源于人类与 GPT-4o 注释的结合。(3)最终,依据 FRABench,我们开发了 UFEval——一个具备任务与方面通用性的统一细粒度评估器。实验表明,在特定方面上进行学习可使 UFEval 推广至未见方面,联合学习以评估多样化视觉任务和方面可带来显著的相互益处。
引用
@article{arxiv.2505.12795,
title = {FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization},
author = {Shibo Hong and Jiahao Ying and Haiyuan Liang and Mengdi Zhang and Jun Kuang and Jiazheng Zhang and Yixin Cao},
journal= {arXiv preprint arXiv:2505.12795},
year = {2025}
}