看到它,说出它,搞定它:用于组合式图表生成的智能体系统
人工智能
2025-11-18 v2 计算机视觉与模式识别
多智能体系统
摘要
我们研究了草图到图表的生成:将粗略的手绘草图转换为精确的组合式图表。扩散模型在照片级真实感方面表现出色,但在流程图所需的空间精度、对齐和符号结构方面存在困难。我们引入了“看到它,说出它,搞定它”,这是一个无需训练的智能体系统,它将视觉语言模型(VLM)与大型语言模型(LLM)耦合,以生成可编辑的可缩放矢量图形(SVG)程序。该系统运行一个迭代循环,其中,一个评论家VLM提出一小组定性的、关系性的编辑建议;多个候选LLM采用多样化的策略(保守→激进、替代、聚焦)合成SVG更新;然后,一个裁判VLM选择最佳候选,确保稳定改进。这种设计优先考虑定性推理而非脆弱的数值估计,保留了全局约束(例如,对齐、连接性),并自然地支持人机协同修正。在10张源自已发表论文流程图的草图上,我们的方法比两个前沿的闭源图像生成LLM(GPT-5和Gemini-2.5-Pro)更忠实地重建了布局和结构,准确地组合了图元(例如,多头箭头),且没有插入不需要的文本。由于输出是可编程的SVG,该方法可以通过API轻松扩展到演示工具(例如,PowerPoint),并可以通过改进的提示词和特定任务工具进行专业化。代码库已在https://github.com/hantaoZhangrichard/see_it_say_it_sorted.git开源。
引用
@article{arxiv.2508.15222,
title = {See it. Say it. Sorted: Agentic System for Compositional Diagram Generation},
author = {Hantao Zhang and Jingyang Liu and Ed Li},
journal= {arXiv preprint arXiv:2508.15222},
year = {2025}
}