TikZilla:基于高质量数据和强化学习的文本到TikZ扩展
人工智能
2026-03-26 v2 计算与语言
计算机视觉与模式识别
摘要
大型语言模型 (LLM) 越来越多地用于帮助科学家跨越多样化工作流程。一个关键挑战是从文本描述生成高质量图形,通常表示为可以渲染为科学图像的TikZ程序。先前研究提出了各种数据集和建模方法用于此任务。然而,现有文本到TikZ的数据集太小且噪声太大,无法捕捉TikZ的复杂性,导致文本与渲染图形之间存在不匹配。此外,先前的方法仅依赖监督微调 (SFT),无法将模型暴露于渲染图语义中,常导致循环、无关内容和错误的空间关系等错误。为了解决这些问题,我们构建了DaTikZ-V4,比DaTikZ-V3更大且质量更高的数据集,丰富了LLM生成的图形描述。使用该数据集,我们训练了TikZilla,一个小型开源Qwen模型 (3B和8B) 的系列,使用 SFT 后跟强化学习 (RL) 的两个阶段管道。对于 RL,我们利用通过逆图形学习训练的图像编码器提供语义忠实的奖励信号。大量人类评估超过1000次判断显示,TikZilla 在 5 分尺度上比其基础模型提高 1.5-2 分,超过 GPT-4o 0.5 分,匹配 GPT-5 在基于图像的评估中,同时在更小的模型规模下运行。代码、数据和模型将公开提供。
引用
@article{arxiv.2603.03072,
title = {TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning},
author = {Christian Greisinger and Steffen Eger},
journal= {arXiv preprint arXiv:2603.03072},
year = {2026}
}