面向英汉混合码切换语音识别的单语数据选择分析
音频与语音处理
2020-09-15 v2
摘要
本文针对在中国举办的一场真实码切换(CS)语音识别(CSSR)竞赛,开展了构建英汉码切换语音识别系统时的数据选择分析。整体训练集包含三个子集,即一个码切换数据集、一个英语(LibriSpeech)和一个汉语数据集。码切换数据以汉语为主导。首先,发现使用全部数据会导致更差的结果,因此数据选择研究是必要的。进而在利用单语数据方面,我们发现数据匹配至关重要。汉语数据与码切换数据中的汉语部分紧密匹配,而英语数据则不然。然而,汉语数据仅对那些显著以汉语为主导的语句有帮助。此外,存在一个平衡点,超过该点更多单语数据会使CSSR系统偏离,导致结果退化。最后,我们分析了结合单语数据以HMM-DNN混合框架训练CSSR系统的有效性。该CSSR系统可执行语句内码切换识别,但仍与在码切换数据上训练的系统存在差距。
引用
@article{arxiv.2006.07094,
title = {Monolingual Data Selection Analysis for English-Mandarin Hybrid Code-switching Speech Recognition},
author = {Haobo Zhang and Haihua Xu and Van Tung Pham and Hao Huang and Eng Siong Chng},
journal= {arXiv preprint arXiv:2006.07094},
year = {2020}
}
备注
5 pages, conference, Accepted by Interspeech2020