中文

用于 2020 福尔摩沙语音识别挑战赛的 NTNU 台湾语 ASR 系统

音频与语音处理 2021-07-13 v4 信号处理

摘要

本文描述了参加由福尔摩沙野外语音项目(FSW)支持的 2020 福尔摩沙语音识别挑战赛(FSR-2020)的 NTNU ASR 系统。FSR-2020 旨在促进台湾语语音识别的发展。除台湾语在声调与方言上的变异问题外,最终测试阶段还需处理人工掺入不同类型真实世界噪声的语音;这些都使 FSR-2020 比以往更具挑战性。为应对资源不足问题,我们 ASR 系统的主要技术方面包括多种深度学习技术,如迁移学习、半监督学习、前端语音增强与模型集成,以及对训练数据所进行的数据清洗与数据增广。在最佳配置下,我们的系统在最终测试集上取得 13.1% 音节错误率(SER),在 Track 3 所有参赛系统中夺得第一。

关键词

引用

@article{arxiv.2104.04221,
  title  = {The NTNU Taiwanese ASR System for Formosa Speech Recognition Challenge 2020},
  author = {Fu-An Chao and Tien-Hong Lo and Shi-Yan Weng and Shih-Hsuan Chiu and Yao-Ting Sung and Berlin Chen},
  journal= {arXiv preprint arXiv:2104.04221},
  year   = {2021}
}

备注

17 pages, 3 figures, Accepted for publication in IJCLCLP