休斯顿,我们遇到了分歧:ASR模型的子组性能分析
音频与语音处理
2025-12-19 v1 机器学习
声音
摘要
Fearless Steps APOLLO社区资源为探索NASA阿波罗任务中多说话人团队通信的潜力提供了无与伦比的机会。本研究聚焦于发现使阿波罗录音对自动语音识别(ASR)方法更易或更难识别的特征。我们为每段音频提取了可解释的元数据:录音特征(信噪比、频谱平坦度、停顿存在性、句子时长)、转录特征(所说单词数、语速)或先验已知特征(说话人)。我们基于这些元数据的组合识别音频录音的子组,并计算每个子组的性能(例如词错误率)以及相对于整体总体的性能差异(“分歧”)。然后,我们应用不同大小的Whisper模型,这些模型在纯英语或多语言数据集上训练,采用零样本或微调方式。我们进行了多项分析,以(i)自动识别并描述给定模型中最有问题的子组,(ii)考察微调相对于零样本在子组层面的影响,(iii)理解模型大小对子组性能的影响,以及(iv)分析多语言模型是否比单语模型对子组性能差异更敏感。这些见解加深了我们对子组特定性能变化的理解,为优化面向地空通信的ASR系统铺平了道路。
引用
@article{arxiv.2404.07226,
title = {Houston we have a Divergence: A Subgroup Performance Analysis of ASR Models},
author = {Alkis Koudounas and Flavio Giobergia},
journal= {arXiv preprint arXiv:2404.07226},
year = {2025}
}
备注
2 pages