DiagrammerGPT:通过 LLM 规划生成开放领域、开放平台图表
计算机视觉与模式识别
2024-07-16 v2 人工智能
计算与语言
机器学习
摘要
文本到图像(T2I)生成在过去几年中显著发展。尽管如此,利用 T2I 模型生成图表的工作甚少。图表是一种符号化/示意性表示,使用结构丰富且空间复杂的可视化(例如相关对象、文本标签、方向箭头/线条等的密集组合)来解释信息。现有最先进的 T2I 模型常在图表生成上失败,因为当许多对象通过箭头/线条等复杂关系密集连接时,它们缺乏细粒度对象布局控制,且常无法渲染清晰的文本标签。为弥补此不足,我们提出 DiagrammerGPT,一种利用 LLM 布局引导能力生成更准确图表的新颖两阶段文本到图表生成框架。第一阶段,我们使用 LLM 生成并在规划器—审计器反馈循环中迭代优化“图表规划”。第二阶段,我们使用图表生成器 DiagramGLIGEN 与文本标签渲染模块,依据图表规划生成带清晰文本标签的图表。为对文本到图表生成任务进行基准测试,我们引入 AI2D-Caption,一个构建于 AI2D 数据集之上的密集标注图表数据集。我们表明 DiagrammerGPT 框架生成更准确的图表,优于现有 T2I 模型。我们还提供了全面分析,包括开放领域图表生成、多平台矢量图形图表生成、人在回路编辑以及多模态规划器/审计器 LLM。
引用
@article{arxiv.2310.12128,
title = {DiagrammerGPT: Generating Open-Domain, Open-Platform Diagrams via LLM Planning},
author = {Abhay Zala and Han Lin and Jaemin Cho and Mohit Bansal},
journal= {arXiv preprint arXiv:2310.12128},
year = {2024}
}
备注
COLM 2024; Project page: https://diagrammerGPT.github.io/