面向多样化输入音频表示的语音识别晚期融合集成
音频与语音处理
2024-12-04 v1 机器学习
声音
摘要
我们探索了语音音频的多样化表示及其对E-Branchformer模型晚期融合集成在自动语音识别(ASR)任务中性能的影响。尽管众所周知,集成方法常能提升语音识别系统的性能,但探索大规模和大型E-Branchformers在此设置下的表现,尤其是当其基础模型在输入语音音频的多样化表示上进行训练时,仍颇具探索意义。结果在四个广泛使用的基准数据集上进行评估:\textit{Librispeech、Aishell、Gigaspeech、TEDLIUMv2},显示相较于在这些数据集上使用相同技术训练的状态最佳模型,仍可实现的性能提升。值得注意的是,尽管使用语言模型,此类集成仍能带来改进,尽管提升幅度正在缩小。
关键词
引用
@article{arxiv.2412.01861,
title = {Late fusion ensembles for speech recognition on diverse input audio representations},
author = {Marin Jezidžić and Matej Mihelčić},
journal= {arXiv preprint arXiv:2412.01861},
year = {2024}
}