中文

Transsion TSUP 面向 ASRU 2023 MADASR 挑战赛的语音识别系统

计算与语言 2023-07-25 v1 声音 音频与语音处理

摘要

本文介绍了传音语音理解处理团队(TSUP)为 ASRU 2023 MADASR 挑战赛开发的语音识别系统。该系统专注于使 ASR 模型适配低资源印度语言,并覆盖了挑战赛的全部四个赛道。对于赛道 1 和 2,声学模型采用 squeezeformer 编码器与双向 transformer 解码器,并使用联合 CTC-Attention 训练损失。此外,在 TLG 束搜索解码过程中使用了外部 KenLM 语言模型。对于赛道 3 和 4,采用了预训练的 IndicWhisper 模型,并在挑战赛数据集与公开可用数据集上进行了微调。whisper 束搜索解码也被修改以支持外部 KenLM 语言模型,从而更好地利用挑战赛提供的额外文本。所提方法在四个赛道中针对孟加拉语的词错误率(WER)分别为 24.17%、24.43%、15.97% 和 15.97%,针对博杰普尔语的 WER 分别为 19.61%、19.54%、15.48% 和 15.48%。这些结果证明了所提方法的有效性。

关键词

引用

@article{arxiv.2307.11778,
  title  = {Transsion TSUP's speech recognition system for ASRU 2023 MADASR Challenge},
  author = {Xiaoxiao Li and Gaosheng Zhang and An Zhu and Weiyong Li and Shuming Fang and Xiaoyue Yang and Jianchao Zhu},
  journal= {arXiv preprint arXiv:2307.11778},
  year   = {2023}
}