从像素到路径:面向可编辑科学插图的多智能体框架
计算机视觉与模式识别
2025-11-03 v1
摘要
科学插图需要兼顾高信息密度和后期编辑性。然而,当前生成模型存在两个主要局限:首先,图像生成模型输出的光栅化图像缺乏语义结构,无法访问、编辑或重新排列图像中独立的视觉组件;其次,基于代码的生成方法(如 TikZ 或 SVG),虽然提供元素级控制,但迫使用户进入繁琐的“编写-编译-审查”循环,缺乏直观的操控性。上述两种方法都难以满足科学创作中效率、直观性和迭代修改的需求。为填补这一差距,我们引入 VisPainter,一个基于模型上下文协议构建的科学插图多智能体框架。VisPainter 协调三个专门模块——经理、设计师和工具箱——协同生成与标准矢量图形软件兼容的图表。这种模块化、基于角色的设计允许每个元素被显式表示和操控,从而实现真正的元素级控制,任何元素都可以后续添加和修改。为系统评估科学插图质量,我们引入 VisBench 基准测试,包含七维评估指标。它从内容、布局、视觉感知和交互成本四个方面评估高信息密度科学插图。为此,我们进行了大量消融实验以验证架构的合理性和评估方法的可靠性。最后,我们评估了各种视觉语言模型,给出公平可信的模型排名及详细比较。此外,我们还隔离并量化了角色划分、步骤控制和描述对插图质量的影响。
引用
@article{arxiv.2510.27452,
title = {From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration},
author = {Jianwen Sun and Fanrui Zhang and Yukang Feng and Chuanhao Li and Zizhen Li and Jiaxin Ai and Yifan Chang and Yu Dai and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2510.27452},
year = {2025}
}