中文

AutomaTikZ:基于 TikZ 的文本引导科学矢量图形合成

计算与语言 2024-05-02 v2 计算机视觉与模式识别

摘要

从文本生成位图图形已受到相当关注,然而对于科学图形,矢量图形往往更受青睐。鉴于矢量图形通常使用底层图形基元编码,直接生成它们较为困难。为此,我们提出使用 TikZ(一种可编译为矢量图形的知名抽象图形语言)作为科学图形的中间表示。TikZ 提供面向人类的高级命令,从而便于利用任意大语言模型进行条件语言建模。为此,我们引入 DaTikZ,首个由 12 万条与标题对齐的 TikZ 绘图组成的大规模 TikZ 数据集。我们在 DaTikZ 上微调 LLaMA,以及我们的新模型 CLiMA,后者以多模态 CLIP 嵌入增强 LLaMA。在人工与自动评估中,CLiMA 与 LLaMA 在与人绘图形的相似度上优于商业 GPT-4 与 Claude 2,且 CLiMA 额外改善了文本-图像对齐。我们的详细分析表明所有模型泛化良好且不易记忆。然而,GPT-4 与 Claude 2 相较于人类及我们的模型倾向于生成更简单的图形。我们公开了我们的框架 AutomaTikZ,以及模型权重与数据集。

关键词

引用

@article{arxiv.2310.00367,
  title  = {AutomaTikZ: Text-Guided Synthesis of Scientific Vector Graphics with TikZ},
  author = {Jonas Belouadi and Anne Lauscher and Steffen Eger},
  journal= {arXiv preprint arXiv:2310.00367},
  year   = {2024}
}

备注

Accepted at ICLR 2024 (poster); Project Page: https://github.com/potamides/AutomaTikZ