中文

AIBench:评估学术插图生成中的视觉-逻辑一致性

计算机视觉与模式识别 2026-04-01 v2

摘要

尽管图像生成技术在不断快速演进,推动了众多应用,但是否能够产生可直接用于论文的学术插图仍大体未知。直接比较或评估与 VLM 对比虽然自然,但需要判官具有多模态理解能力,这在面对长篇复杂文本和插图时不可靠。为此,我们提出 AIBench——首个采用 VQA 评估学术插图逻辑正确性、VLMs 评估美学的基准测试。具体而言,我们设计了四个层次的问题,这些问题基于从论文方法部分总结的逻辑图,查询生成的插图是否在不同尺度上与论文保持一致。我们的 VQA 方法在减少判官 VLM 能力依赖方面提高了评估的准确性和细节性。通过高质量的 AIBench,我们进行了大规模实验,得出结论:模型在此任务上的表现差距显著大于一般任务,反映出其在复杂推理和高密度生成方面的差异。进一步实验表明,逻辑与美学的优化困难重重,正如手工制作插图一样。额外实验进一步表明,对两项能力进行测试时扩展显著提升了此任务的性能。

关键词

引用

@article{arxiv.2603.28068,
  title  = {AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation},
  author = {Zhaohe Liao and Kaixun Jiang and Zhihang Liu and Yujie Wei and Junqiu Yu and Quanhao Li and Hong-Tao Yu and Pandeng Li and Yuzheng Wang and Zhen Xing and Shiwei Zhang and Chen-Wei Xie and Yun Zheng and Xihui Liu},
  journal= {arXiv preprint arXiv:2603.28068},
  year   = {2026}
}