HYKIST 项目中面向越南语自动语音识别的无监督预训练
计算与语言
2023-09-29 v1 声音
音频与语音处理
摘要
在当今互联互通的世界中,出于就业、难民安置或其他原因,移居国外愈发普遍。本地人与移民之间的语言障碍是日常生活中一个常见问题,尤其在医疗领域。这会使患者在问诊或急诊时与医生沟通困难,从而影响患者照护。HYKIST 项目的目标是开发一种语音翻译系统,借助 ASR 与 MT 支持医患沟通。ASR 系统近来在特定任务上展现出惊人性能,例如 LibriSpeech 等具备足量训练数据的任务。但由于说话风格多样、声学与环境设置各异以及缺乏领域内训练数据,构建良好模型仍然困难。在本论文中,我们描述了为越南语医疗领域对话式电话语音识别任务构建 ASR 系统的努力,以协助急诊室中跨语言障碍的医患沟通。为提升系统性能,我们探究了多种训练调度与数据组合策略。我们也考察了如何最好地利用现有的少量数据。我们将公开可用模型(如 XLSR-53)的使用与定制预训练模型的使用进行比较,并以 wav2vec 2.0 为架构同时采用监督与无监督方法。
引用
@article{arxiv.2309.15869,
title = {Unsupervised Pre-Training for Vietnamese Automatic Speech Recognition in the HYKIST Project},
author = {Khai Le-Duc},
journal= {arXiv preprint arXiv:2309.15869},
year = {2023}
}
备注
Bachelor Thesis