中文

GENFIG1:学术作品的视觉总结作为视觉-语言模型的挑战

计算机视觉与模式识别 2026-04-07 v1 人工智能

摘要

在许多科学论文中,"图 1" 作为核心研究思想的主要视觉总结。这些图形在视觉上简洁却概念丰富,往往需要人类作者付出大量时间和迭代才能做好,凸显了科学视觉表达的难度。基于此直觉,我们引入 GENFIG1,面向生成式 AI 模型(如视觉-语言模型)的基准测试。GENFIG1 评估模型生成能够清晰表达论文核心思想(包括标题、摘要、引言和图注)的图形的能力。解决 GENFIG1 不仅需要制作视觉上吸引人的图形,还要求进行文本到图像生成的推理,将科学理解与视觉合成相结合。具体而言,模型必须 (i) 理解并把握论文的技术概念, (ii) 识别最具代表性的概念, (iii) 设计一个连贯且视觉效果良好的图形,以可视化方式传达这些概念,且忠实于输入。我们从顶级深度学习会议上发表的论文中构建基准,应用严格的质量控制,并引入一种与专家人类判断高度相关的自动评估指标。我们对代表性模型在 GENFIG1 上进行评估,证明该任务对最佳系统而言也具有显著挑战。我们希望此基准为未来多模态 AI 的进步奠定基础。

关键词

引用

@article{arxiv.2604.04172,
  title  = {GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models},
  author = {Yaohan Guan and Pristina Wang and Najim Dehak and Alan Yuille and Jieneng Chen and Daniel Khashabi},
  journal= {arXiv preprint arXiv:2604.04172},
  year   = {2026}
}