K-Wav2vec 2.0:基于字母与音节联合解码的韩文自动语音识别
计算与语言
2021-10-12 v1
摘要
Wav2vec 2.0 是一种用于语音表征自监督学习的端到端框架,在自动语音识别(ASR)中表现成功,但关于该主题的大部分工作都是针对单一语言:英语。因此,尚不清楚该自监督框架是否能有效识别具有不同文字系统的其他语言,例如使用具有独特文字系统的韩文(Hangul)的韩语。本文提出 K-Wav2Vec 2.0,它是 Wav2vec 2.0 的改进版本,通过探索和优化原始 Wav2vec 2.0 的各种因素而设计用于韩文自动语音识别。在微调中,我们提出一种多任务分层架构以反映韩文书写结构。此外,应用联合解码器以缓解词表外词存在的问题。在预训练中,考虑到资源有限,我们通过对英语 Wav2vec 2.0 在韩语数据集上进一步预训练,尝试了预训练模型的跨语言迁移。实验结果表明,所提方法在两个韩文 ASR 数据集上均取得最佳性能:Ksponspeech(大规模韩文语音语料库)和 Clovacall(基于通话的对话语料库)。进一步预训练在语言自适应方面也有效,无需额外数据即可带来大幅提升。
引用
@article{arxiv.2110.05172,
title = {K-Wav2vec 2.0: Automatic Speech Recognition based on Joint Decoding of Graphemes and Syllables},
author = {Jounghee Kim and Pilsung Kang},
journal= {arXiv preprint arXiv:2110.05172},
year = {2021}
}
备注
13 pages, 4 figures