GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
计算机视觉与模式识别
2026-02-06 v1 人工智能
摘要
视觉生成模型的快速进步已超前于传统评估方法,迫切需要采用视觉语言模型作为评估替代品。在本工作中,我们系统性地调查了在广泛的视觉生成任务上,主流绝对点评分标准的可靠性。我们的分析发现,这一范式受到随机不一致性和不良的人类感知对齐性的限制。为解决这些限制,我们引入 GenArena,一个统一的评估框架,利用成对比较范式确保评估稳定且符合人类感知。关键的是,我们的实验发现,仅仅采用这种成对协议就能使面向开源模型的表现超过顶尖的专有模型。值得注意的是,我们的方法将评估准确率提升了 20%以上,并实现了与权威 LMArena 排行榜的 0.86 的 Spearman 相关系数,显著超过了点评方法的 0.36 相关系数。基于 GenArena,我们对视觉生成模型在多样化任务上的最新技术进行基准测试,为社区提供了严谨且自动化的视觉生成评估标准。
引用
@article{arxiv.2602.06013,
title = {GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?},
author = {Ruihang Li and Leigang Qu and Jingxu Zhang and Dongnan Gui and Mengde Xu and Xiaosong Zhang and Han Hu and Wenjie Wang and Jiaqi Wang},
journal= {arXiv preprint arXiv:2602.06013},
year = {2026}
}
备注
Project Page: https://genarena.github.io/, Code: https://github.com/ruihanglix/genarena