中文

自动语音识别中的数值表达式处理

音频与语音处理 2025-06-24 v2 人工智能 计算与语言

摘要

本文解决了在自动语音识别 (ASR) 转录中正确格式化数值表达式的问题。由于预期转录格式取决于上下文,例如 1945(年份)与 19:45(时间戳)不同,因此这一问题具有挑战性。我们比较了级联式方法和端到端方法,以识别和格式化此类数值表达式,包括年份、时间戳、货币金额和数量。对于端到端方法,我们采用基于大型语言模型 (LLM) 的数据生成策略,结合语音合成 (TTS) 模型,以生成适配数据。我们在测试数据集上的结果表明,虽然基于 LLM 的方法在识别格式化数值表达式方面表现良好,但适配后的端到端模型在性能上具有竞争力,同时具有更低的延迟和推理成本优势。

关键词

引用

@article{arxiv.2408.00004,
  title  = {Handling Numeric Expressions in Automatic Speech Recognition},
  author = {Christian Huber and Alexander Waibel},
  journal= {arXiv preprint arXiv:2408.00004},
  year   = {2025}
}