利用半监督转写假设中的异质性改进码切换语音识别
计算与语言
2021-06-16 v1 声音
音频与语音处理
摘要
码切换语音建模是自动语音识别(ASR)中的一个重要问题。带标注的码切换数据十分稀缺,因此常利用单语数据来建模码切换语音。这些单语数据可能与码切换对中的某一语言匹配得更紧密。我们表明,这种不对称性会使预测偏向匹配更好的语言,从而降低整体模型性能。为解决该问题,我们提出一种用于码切换 ASR 的半监督方法。我们考虑英-汉码切换情形,以及利用单语数据构建双语“转写模型”以标注无标签码切换数据的问题。我们首先构建多个转写模型,使其各自预测分别偏向英语或汉语。随后基于置信度选择将这些有偏转写进行组合。该策略生成了更优的半监督训练转写文本,并相较仅使用最佳匹配单语数据构建的转写模型的半监督系统取得了 19% 的相对提升。
引用
@article{arxiv.2106.07699,
title = {Using heterogeneity in semi-supervised transcription hypotheses to improve code-switched speech recognition},
author = {Andrew Slottje and Shannon Wotherspoon and William Hartmann and Matthew Snover and Owen Kimball},
journal= {arXiv preprint arXiv:2106.07699},
year = {2021}
}
备注
5 pages