BizGenEval: 商业视觉内容生成的系统性基准测试
计算机视觉与模式识别
2026-03-27 v1
摘要
图像生成模型的最新进展已将其应用从美学图像扩展到实用视觉内容创作。然而,现有基准测试主要聚焦于自然图像合成,未能在真实商业设计任务的结构化和多约束条件下系统评估模型。在这项工作中,我们引入了 BizGenEval,一个用于商业视觉内容生成的系统性基准测试。该基准测试涵盖五种代表性文档类型:幻灯片、图表、网页、海报和科学图表,并评估四个关键能力维度:文本渲染、布局控制、属性绑定和知识推理,形成 20 个多样化的评估任务。BizGenEval 包含 400 个精心策划的提示和 8000 个人工验证的清单问题,以严格评估生成图像是否满足复杂的视觉和语义约束。我们对 26 个热门图像生成系统进行了大规模基准测试,包括最先进的商业 API 和领先的开放源代码模型。结果揭示了当前生成模型与专业视觉内容创作需求之间的显著能力差距。我们希望 BizGenEval 能成为真实商业视觉内容生成的标准基准测试。
引用
@article{arxiv.2603.25732,
title = {BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation},
author = {Yan Li and Zezi Zeng and Ziwei Zhou and Xin Gao and Muzhao Tian and Yifan Yang and Mingxi Cheng and Qi Dai and Yuqing Yang and Lili Qiu and Zhendong Wang and Zhengyuan Yang and Xue Yang and Lijuan Wang and Ji Li and Chong Luo},
journal= {arXiv preprint arXiv:2603.25732},
year = {2026}
}