基于图标签传播的跨语句 ASR 重打分
音频与语音处理
2024-02-09 v1 计算与语言
机器学习
声音
摘要
我们提出一种利用跨语句声学相似度、通过基于图的标签传播进行 ASR N-best 假设重打分的新方法。与传统的基于神经语言模型(LM)的 ASR 重打分/重排序模型不同,我们的方法关注声学信息,并在语句间协作完成重打分,而非逐句独立进行。在 VCTK 数据集上的实验表明,我们的方法持续提升了 ASR 性能,以及不同口音说话人组间的公平性。我们的方法为缓解 ASR 系统的大多数群体偏置提供了一种低成本方案,且无需训练新的特定领域或特定口音模型。
引用
@article{arxiv.2303.15132,
title = {Cross-utterance ASR Rescoring with Graph-based Label Propagation},
author = {Srinath Tankasala and Long Chen and Andreas Stolcke and Anirudh Raju and Qianli Deng and Chander Chandak and Aparna Khare and Roland Maas and Venkatesh Ravichandran},
journal= {arXiv preprint arXiv:2303.15132},
year = {2024}
}
备注
To appear in IEEE ICASSP 2023