图像到 LaTeX 转换器:用于数学公式和文本
计算与语言
2024-08-09 v1 计算机视觉与模式识别
摘要
在本项目中,我们训练了一个视觉编码器-解码器模型,用于从数学公式和文本图像生成 LaTeX 代码。利用多样化的图像到 LaTeX 数据集,我们构建了两个模型:一个采用 Swin Transformer 编码器和 GPT-2 解码器的基础模型,基于机器生成的图像进行训练;以及经过微调的改进模型,引入低秩适应 (LoRA) 并在手写公式上进行训练。我们将该模型在手写测试集上的 BLEU 性能与其他类似模型(如 Pix2Text、TexTeller 和 Sumen)进行比较。通过本项目,我们贡献开源模型用于图像到 LaTeX 转换,并提供从头构建这些模型的完整代码,包括分布式训练和 GPU 优化。
引用
@article{arxiv.2408.04015,
title = {Image-to-LaTeX Converter for Mathematical Formulas and Text},
author = {Daniil Gurgurov and Aleksey Morshnev},
journal= {arXiv preprint arXiv:2408.04015},
year = {2024}
}
备注
4 pages