中文

基于海量视频数据的弱监督自动语音识别系统构建

音频与语音处理 2020-09-22 v2 计算与语言 机器学习 声音

摘要

从零开始构建自动语音识别(ASR)系统极具挑战性,主要原因在于使用转录文本标注大量音频数据的过程耗时且昂贵。尽管已有若干无监督预训练模型被提出,但若能以较低成本获取更多带标注的训练数据,直接应用此类模型仍可能并非最优。本文提出一种利用海量视频数据弱监督构建ASR系统的框架。由于视频通常包含与字幕对齐的人声语音音频,我们将视频视为重要知识来源,并基于光学字符识别(OCR)提出一种从视频中提取与转录文本对齐的高质量音频的有效方法。在弱监督预训练后,底层ASR模型可微调以适配任意特定领域目标训练数据集。大量实验表明,我们的框架在六个普通话语音识别公开数据集上可轻松取得最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.2008.01300,
  title  = {Weakly Supervised Construction of ASR Systems with Massive Video Data},
  author = {Mengli Cheng and Chengyu Wang and Xu Hu and Jun Huang and Xiaobo Wang},
  journal= {arXiv preprint arXiv:2008.01300},
  year   = {2020}
}