AutoMode-ASR: 学习为更好的质量和成本选择ASR系统
计算与语言
2024-09-20 v1 声音
音频与语音处理
摘要
我们提出AutoMode-ASR,一个新型框架有效地整合多个ASR系统以提升整体转录质量的同时优化成本。核心思想是训练决策模型,仅凭音频输入为每个片段选择最佳ASR系统。在实现此目标方面,我们通过ensemble二分类器决定两个系统之间的偏好。这些分类器配备多种特征,包括音频嵌入、质量估计和信号属性。此外,我们展示使用质量估计器可进一步提升性能,同时增加极少的成本。实验结果显示,相对于为所有片段使用单一最佳模型,WER降低16.2%,成本节省65%,速度提升75%。我们的框架与商业和开源黑盒ASR系统兼容,无需修改模型代码。
引用
@article{arxiv.2409.12476,
title = {AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost},
author = {Ahmet Gündüz and Yunsu Kim and Kamer Ali Yuksel and Mohamed Al-Badrashiny and Thiago Castro Ferreira and Hassan Sawaf},
journal= {arXiv preprint arXiv:2409.12476},
year = {2024}
}
备注
SPECOM 2024 Conference