AutomaTikZ:基于 TikZ 的文本引导科学矢量图形合成
计算与语言
2024-05-02 v2 计算机视觉与模式识别
摘要
从文本生成位图图形已受到相当关注,然而对于科学图形,矢量图形往往更受青睐。鉴于矢量图形通常使用底层图形基元编码,直接生成它们较为困难。为此,我们提出使用 TikZ(一种可编译为矢量图形的知名抽象图形语言)作为科学图形的中间表示。TikZ 提供面向人类的高级命令,从而便于利用任意大语言模型进行条件语言建模。为此,我们引入 DaTikZ,首个由 12 万条与标题对齐的 TikZ 绘图组成的大规模 TikZ 数据集。我们在 DaTikZ 上微调 LLaMA,以及我们的新模型 CLiMA,后者以多模态 CLIP 嵌入增强 LLaMA。在人工与自动评估中,CLiMA 与 LLaMA 在与人绘图形的相似度上优于商业 GPT-4 与 Claude 2,且 CLiMA 额外改善了文本-图像对齐。我们的详细分析表明所有模型泛化良好且不易记忆。然而,GPT-4 与 Claude 2 相较于人类及我们的模型倾向于生成更简单的图形。我们公开了我们的框架 AutomaTikZ,以及模型权重与数据集。
引用
@article{arxiv.2310.00367,
title = {AutomaTikZ: Text-Guided Synthesis of Scientific Vector Graphics with TikZ},
author = {Jonas Belouadi and Anne Lauscher and Steffen Eger},
journal= {arXiv preprint arXiv:2310.00367},
year = {2024}
}
备注
Accepted at ICLR 2024 (poster); Project Page: https://github.com/potamides/AutomaTikZ