PixelArena:像素级视觉智能基准
计算机视觉与模式识别
2026-01-12 v2 人工智能
摘要
拥有多模态输入与输出能力的全模态模型正逐渐兴起。然而,对这些模型进行多模态基准测试尤其是图像生成方面具有挑战性,因人类偏好与模型偏见存在细微差异。许多图像生成基准仅聚焦于审美,未能客观评估这些模型在细粒度生成能力上的视觉智能。PixelArena 提出以语义分割任务为基准,客观检验其在像素级精度下的细粒度生成智能。通过本基准与实验,我们发现最新的 Gemini 3 Pro Image 在零样本设置下展现出生成高保真语义掩码的涌现性图像生成能力,展示了此前前所未有的视觉智能与在新图像生成任务中的真正泛化能力。我们进一步系统性地对其结果进行分析,与其他模型进行定性与定量比较,并呈现失败案例。这些发现不仅信号了该领域的激动人心的进展,也为数据集开发、全模态模型发展以及指标设计提供了洞见。
引用
@article{arxiv.2512.16303,
title = {PixelArena: A benchmark for Pixel-Precision Visual Intelligence},
author = {Feng Liang and Sizhe Cheng and Chenqi Yi and Yong Wang},
journal= {arXiv preprint arXiv:2512.16303},
year = {2026}
}
备注
8 pages, 11 figures, project page: https://pixelarena.reify.ing/project