UEval:用于统一多模态生成的基准
计算机视觉与模式识别
2026-01-30 v1 计算与语言
摘要
我们介绍 UEval,这是一个评估统一模型的基准,即能够生成图像和文本的模型。UEval 包含 1,000 个专家精选问题,需要模型输出中包含图像和文本, sourced from 8 个真实世界任务。我们的精选问题涵盖了从分步指南到教科书解释等多种推理类型。在评估开放式多模态生成时,单纯的 LLM 评判方法往往难以捕捉细微差别。不同于以往依赖多模态大语言模型(MLLM)评估图像质量或文本准确性的工作,我们在 UEval 中设计了基于评分标准的评分系统。对于每个问题,提供参考图像和文本答案供 MLLM 生成初始评分标准,然后由人类专家细化和验证这些标准。总体而言,UEval 包含 10,417 项经过验证的评分标准,实现可扩展且细粒度的自动评分。UEval 对当前统一模型都具有挑战性:GPT-5-Thinking 仅得 66.4 分,而最好的开源模型仅达到 49.1 分。我们观察到,具有推理能力的模型往往优于非推理模型,将推理轨迹从推理模型迁移到非推理模型可显著缩小差距。这表明推理在需要复杂多模态理解和生成的任务中可能至关重要。
引用
@article{arxiv.2601.22155,
title = {UEval: A Benchmark for Unified Multimodal Generation},
author = {Bo Li and Yida Yin and Wenhao Chai and Xingyu Fu and Zhuang Liu},
journal= {arXiv preprint arXiv:2601.22155},
year = {2026}
}