ASR 指标的鲁棒近似方法
计算与语言
2025-06-06 v2
摘要
近期语音基础模型的进步主要得益于模型规模和数据量的提升,使其能够执行广泛的任务,包括语音识别。传统上,语音识别模型的评估使用基于 Word Error Rate(WER)和 Character Error Rate(CER)的指标,这些指标依赖于真实标签。由于来自多样化领域和测试条件的标注数据有限,这些模型在标准基准之外的真实泛化能力尚不清楚。此外,标注数据既昂贵又耗时。为此,我们提出了一种 novel 的无标签方法,用于近似 ASR 性能指标,无需真实标签。该方法将语音和转录表示在统一的空间中进行多模态嵌入,结合高质量的代理模型来计算代理指标。这些特征用于训练回归模型以预测关键的 ASR 指标,如 Word Error Rate(WER)和 Character Error Rate(CER)。我们在超过 40 个模型上进行实验,涵盖 14 个数据集,代表标准测试条件和野外测试条件。我们的结果表明,我们在所有实验配置下均以单个位数的绝对差异近似这些指标,优于最新基线方法超过 50%。
引用
@article{arxiv.2502.12408,
title = {On the Robust Approximation of ASR Metrics},
author = {Abdul Waheed and Hanin Atwany and Rita Singh and Bhiksha Raj},
journal= {arXiv preprint arXiv:2502.12408},
year = {2025}
}
备注
ACL 2025 camera-ready