TechImage-Bench:基于评分表的技术图像生成评估
计算机视觉与模式识别
2026-03-19 v2
摘要
我们研究技术图像生成,即模型必须从详细描述中合成信息密集、科学精确的插图,而不仅仅是产生视觉上可信的图片。为量化进展,我们提出TechImage-Bench,一个面向生物学示意图、工程/专利图以及通用技术插图的评分表基准。为654幅收录自真实教科书和技术报告的图,我们构建详细的图像指令和分层评分表,将正确性分解为6,076个准则和44,131个二进制检查。评分表来源于周围文本和参考图,使用大型多模态模型生成,并由基于自动LMM的评估器进行评估,采用原则性的惩罚方案,将子问题结果聚合为可解释的准则得分。我们对TechImage-Bench上的几个代表性文本到图像模型进行基准测试,发现尽管在开放域性能方面表现突出,最佳基础模型在整体上仅达到0.801的评分准确率和0.576的准则得分,揭示了在细粒度科学忠实性方面存在显著差距。最后,我们表明相同的评分表提供了可操作的监督信号:将失败的检查返回给编辑模型进行迭代细化,可将强大生成器的评分准确率从0.660提升至0.865,准则得分从0.382提升至0.697。TechImage-Bench因此为技术图像生成提供了严密的诊断工具,以及改进specification忠实科学插图的可扩展信号。
引用
@article{arxiv.2512.12220,
title = {TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation},
author = {Minheng Ni and Zhengyuan Yang and Yaowen Zhang and Linjie Li and Chung-Ching Lin and Kevin Lin and Zhendong Wang and Xiaofei Wang and Shujie Liu and Lei Zhang and Wangmeng Zuo and Lijuan Wang},
journal= {arXiv preprint arXiv:2512.12220},
year = {2026}
}