中文

Speech-to-LaTeX:将 spoken equations and sentences 转换为 LaTeX 的新模型与数据集

计算机视觉与模式识别 2026-03-12 v2

摘要

将口头数学表达式转换为结构化符号表示是一个具有挑战性的任务,需在消除方程发音歧义的同时,将语音转写为严格的 LaTeX 格式。虽然语音识别(ASR)和语言模型(LM)在自动语音识别方面取得了显著进展,但将口头数学内容转换为 LaTeX 仍未得到充分探索。该任务直接应用于教育和科研领域,如课堂转录或笔记创建。现有方法基于 ASR 后处理,需两次转录,仅针对孤立方程,测试集有限,且缺乏训练数据和多语言覆盖。为此,我们提出首个完全开源大规模数据集,包含超过 66,000 个人工标注的英文和俄语数学方程与句子音频样本,来源于多样化的科学领域。除 ASR 后处理模型和 few-shot 提示外,我们还应用音频语言模型,在 MathSpeech 数据集基准上实现了相当的字错误率(CER)结果(28% 与 30%),方程转换方面。与此相比,在我们提出的 S2L-equations 数据集上,模型以超过 36 个百分点的显著优势超越 MathSpeech 模型,即便考虑到 LaTeX 格式瑕疵(27% vs. 64%)。我们建立了第一个数学句子识别基准(S2L-sentences),实现了 40% 的方程 CER。本工作为多模态 AI 的未来发展奠定了基础,尤其是数学内容识别方面。

关键词

引用

@article{arxiv.2508.03542,
  title  = {Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences},
  author = {Dmitrii Korzh and Dmitrii Tarasov and Artyom Iudin and Elvir Karimov and Matvey Skripkin and Nikita Kuzmin and Andrey Kuznetsov and Oleg Y. Rogov and Ivan Oseledets},
  journal= {arXiv preprint arXiv:2508.03542},
  year   = {2026}
}

备注

22 pages, 2 figures, 16 Tables