MathSpeech:利用小型语言模型实现数学语音到公式的精准转换
计算与语言
2025-04-14 v3 人工智能
摘要
在各种学术和专业场合,如数学讲座或研究报告中,常有必要口头表达数学表达式或公式。然而,若没有伴随的视觉信息,大声朗读数学表达式会显著阻碍理解,尤其是对于听力障碍者或依赖字幕的国际观众来说尤其如此。例如,当讲者朗读欧拉公式时,当前的自动语音识别(ASR)模型常常产生冗长且错误的文本描述(例如:e to the power of i x equals cosine of x plus i side of x),而不是简洁的 格式(即 ),这会阻碍清晰的理解和交流。为此,我们引入 MathSpeech,一个新型的管道,将 ASR 模型与小型语言模型(sLMs)集成,以纠正数学表达式中的错误,并准确地将口语表达转换为结构化的 表示。评估基于新建的讲座录音数据集,MathSpeech 在 生成方面展现出与领先商业大型语言模型(LLMs)相当的能力,同时仅使用 120M 参数的精调小型语言模型。具体而言,就 翻译的 CER、BLEU 和 ROUGE 分数而言,MathSpeech 的能力显著优于 GPT-4o。我们观察到 CER 从 0.390 降至 0.298,ROUGE/BLEU 分数也高于 GPT-4o。
引用
@article{arxiv.2412.15655,
title = {MathSpeech: Leveraging Small LMs for Accurate Conversion in Mathematical Speech-to-Formula},
author = {Sieun Hyeon and Kyudan Jung and Jaehee Won and Nam-Joon Kim and Hyun Gon Ryu and Hyuk-Jae Lee and Jaeyoung Do},
journal= {arXiv preprint arXiv:2412.15655},
year = {2025}
}
备注
Accepted at AAAI 2025