中文

面向语音数学推理:基于多维数学问题的基准测试

计算与语言 2025-05-22 v1

摘要

近期大型语言模型(LLM)和多模态LLM(MLLM)的进展使其在广泛的任务中展现出强大的推理能力。然而,针对语音输入的数学推理能力仍未得到充分探索。以往的语音模态研究主要聚焦于事实性语音理解或简单音频推理任务,难以深入洞察如此需要逻辑逐步推理的数学问题求解。为填补这一空白,我们引入语音数学问答(Spoken-MQA),一个新的基准测试,用于评估语音模型的数学推理能力,包括级联模型(ASR+LLM)和端到端语音LLM。Spoken-MQA涵盖纯算术、单步和多步骤情境推理以及知识导向推理等多样化的数学问题,所有问题均以无歧义的自然语言呈现。通过大量实验,我们发现:(1)虽然一些语音LLM在涉及基本算术的情境推理任务中表现�竞,但仍难以解决直接算术问题;(2)当前LLM对以 LaTeX 书写的符号数学表达式表现出强烈偏好,难以理解口语化的数学表达式;(3)语音LLM的数学知识推理能力显著下降。

关键词

引用

@article{arxiv.2505.15000,
  title  = {Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems},
  author = {Chengwei Wei and Bin Wang and Jung-jae Kim and Nancy F. Chen},
  journal= {arXiv preprint arXiv:2505.15000},
  year   = {2025}
}