中文

面向多样化输入音频表示的语音识别晚期融合集成

音频与语音处理 2024-12-04 v1 机器学习 声音

摘要

我们探索了语音音频的多样化表示及其对E-Branchformer模型晚期融合集成在自动语音识别(ASR)任务中性能的影响。尽管众所周知,集成方法常能提升语音识别系统的性能,但探索大规模和大型E-Branchformers在此设置下的表现,尤其是当其基础模型在输入语音音频的多样化表示上进行训练时,仍颇具探索意义。结果在四个广泛使用的基准数据集上进行评估:\textit{Librispeech、Aishell、Gigaspeech、TEDLIUMv2},显示相较于在这些数据集上使用相同技术训练的状态最佳模型,仍可实现1%14%1\% - 14\%的性能提升。值得注意的是,尽管使用语言模型,此类集成仍能带来改进,尽管提升幅度正在缩小。

关键词

引用

@article{arxiv.2412.01861,
  title  = {Late fusion ensembles for speech recognition on diverse input audio representations},
  author = {Marin Jezidžić and Matej Mihelčić},
  journal= {arXiv preprint arXiv:2412.01861},
  year   = {2024}
}