中文

ASR 指标的鲁棒近似方法

高能物理 - 唯象学 2025-12-03 v3 原子物理

摘要

近期语音基础模型的快速进展主要源于通过放大模型规模和数据量,使其能够执行广泛的任务,包括语音识别。传统上,ASR 模型的评估指标包括基于真实标签的词错误率 (WER) 和字符错误率 (CER),这些指标受限于来自多样化领域和测试条件的有限标注数据,使得这些模型在标准基准之外的真实泛化能力尚不清晰。此外,获取标注数据既昂贵又耗时。为此,我们提出了一种新颖的无标签方法,用于近似评估 ASR 性能指标,无需依赖真实标签。该方法将语音和转录表示统一嵌入到同一特征空间中,结合高质量的代理模型计算代理指标。这些特征用于训练回归模型,以预测诸如词错误率 (WER) 和字符错误率 (CER) 等关键 ASR 指标。我们在超过 40 个模型、14 个数据集上进行实验,涵盖标准测试条件和野外测试环境。结果表明,我们在所有实验配置下均以单个位数的绝对误差范围内近似这些指标,显著优于最新基线方法超过 50%。

关键词

引用

@article{arxiv.2502.12407,
  title  = {Quantum-mechanical numerical model of interaction between dark atom and nucleus of substance},
  author = {T. E. Bikbaev and M. Yu. Khlopov and A. G. Mayorov},
  journal= {arXiv preprint arXiv:2502.12407},
  year   = {2025}
}

备注

Prepared for Proceedings of 27th Bled Workshop "What comes beyond the Standard models?"