PaperBanana:面向AI科学家的学术插图自动化
计算与语言
2026-03-25 v2 计算机视觉与模式识别
摘要
尽管语言模型驱动的自主AI科学家取得了快速进展,但生成出版级插图仍是研究工作流程中的瓶颈性劳动负担。为提升这一负担,我们引入PaperBanana,一个用于自动生成出版级学术插图的智能体框架。基于最先进的视觉语言模型和图像生成模型,PaperBanana编排专用智能体来检索参考文献、规划内容和风格、渲染图像,并通过自我批判进行迭代细化。为严格评估我们的框架,我们引入PaperBananaBench,包含来自NeurIPS 2025出版物的292个测试案例,涵盖多种研究领域和插图风格。全面实验表明,PaperBanana在忠实性、简洁性、可读性和美学方面 consistently 优于领先的基线方法。我们进一步展示了该方法有效地扩展到高质量统计图的生成。总体而言,PaperBanana为自动生成出版级插图铺平了道路。
引用
@article{arxiv.2601.23265,
title = {PaperBanana: Automating Academic Illustration for AI Scientists},
author = {Dawei Zhu and Rui Meng and Yale Song and Xiyu Wei and Sujian Li and Tomas Pfister and Jinsung Yoon},
journal= {arXiv preprint arXiv:2601.23265},
year = {2026}
}
备注
Add Citations