TeXpert:面向 LLM 生成 LaTeX 代码的多层次基准测试
计算与语言
2025-09-16 v1 人工智能
摘要
LaTeX 因其在排版方面的精确性和灵活性,已成为科学文献准备的黄金标准。大型语言模型(LLMs)为研究人员使用自然语言指令生成即插即用 LaTeX 代码的科研出版物提供了广阔的机遇,但当前的基准测试完全缺乏对这一能力的评估。通过引入TeXpert,我们的基准数据集包含针对科学文档各个组成部分、跨多个难度层次的自然语言提示,用于生成 LaTeX 代码。我们对 LLM 在此方面的性能进行深入分析,并识别出常见的错误类型。我们的评估覆盖开源和闭源 LLM,揭示了多个关键发现:在标准基准测试中表现突出的 LLM 在 LaTeX 生成任务中表现不佳,随着任务复杂度的增加 accuracy 明显下降;像 DeepSeek v3 和 DeepSeek Coder 这类开源模型在 LaTeX 任务中与闭源模型大相径庇;格式和包错误意外地很普遍,这表明大多数 LLM 的训练数据集中缺乏多样化的 LaTeX 示例。我们的数据集、代码和模型评估已在 https://github.com/knowledge-verse-ai/TeXpert 提供。
引用
@article{arxiv.2506.16990,
title = {TeXpert: A Multi-Level Benchmark for Evaluating LaTeX Code Generation by LLMs},
author = {Sahil Kale and Vijaykant Nadadur},
journal= {arXiv preprint arXiv:2506.16990},
year = {2025}
}
备注
Accepted to the SDProc Workshop @ ACL 2025