THUEE系统在IARPA OpenASR21挑战赛中的系统描述
计算与语言
2025-01-14 v1 声音
音频与语音处理
摘要
本文描述了THUEE团队面向IARPA开放自动语音识别挑战赛(OpenASR21)的语音识别系统,并给出了进一步的实验探索。我们在受限(Constrained)与受限增强(Constrained-plus)训练条件下均取得了出色结果。对于受限训练条件,我们基于标准混合架构构建基本ASR系统。为缓解集外词(OOV)问题,我们对OOV及潜在新词使用字素到音素(G2P)技术扩展发音词典。采用了CNN-TDNN-F与CNN-TDNN-F-A等标准声学模型结构。此外,应用了多种数据增强技术。对于受限增强训练条件,我们使用自监督学习框架wav2vec2.0。我们在公开可用的预训练模型XLSR-53之上,以连接时序分类(CTC)准则试验了多种微调技术。我们发现,将wav2vec2.0预训练模型应用于基于编码器-解码器的CTC/Attention ASR架构时,前端特征提取器起着重要作用。使用在目标语言中微调的CTC模型作为前端特征提取器可取得额外提升。
引用
@article{arxiv.2206.14660,
title = {The THUEE System Description for the IARPA OpenASR21 Challenge},
author = {Jing Zhao and Haoyu Wang and Jinpeng Li and Shuzhou Chai and Guan-Bo Wang and Guoguo Chen and Wei-Qiang Zhang},
journal= {arXiv preprint arXiv:2206.14660},
year = {2025}
}
备注
accepted by INTERSPEECH 2022