asr_eval:面向多参考语音识别评估的算法与工具
计算与语言
2026-01-30 v1 声音
音频与语音处理
摘要
我们提出了若干改进措施来提升语音识别评估。首先,我们提出了一种支持多参考标记、任意长度插入以及更佳单词对齐的字符串对齐算法。这在处理非拉丁语言、富含词形变化的语言,标记杂乱或长篇语音时尤为有用。其次,我们收集了一个新的测试集DiverseSpeech-Ru,包含大量野生环境下的长篇俄语语音,并进行严谨的多参考标记。我们对流行的俄语测试集进行了多参考重新标记,并研究了其相应训练集上的微调动力学。我们展示,模型常常会适应数据集特定的标记,导致指标改进的幻觉。基于改进后的单词对齐,我们开发了工具来评估流式语音识别,并对多个转录文本进行对齐以进行可视化比较。此外,我们提供了许多离线和流式语音识别模型的统一封装。我们的代码将公开发布。
引用
@article{arxiv.2601.20992,
title = {asr_eval: Algorithms and tools for multi-reference and streaming speech recognition evaluation},
author = {Oleg Sedukhin and Andrey Kostin},
journal= {arXiv preprint arXiv:2601.20992},
year = {2026}
}