面向低资源视频ASR的大规模弱监督与半监督学习
音频与语音处理
2020-08-10 v2 计算与语言
声音
摘要
为克服构建高质量语音识别系统所需的标注成本,已有许多半监督和弱监督方法被研究。在低收入资源条件下转录社交媒体视频这一挑战性任务中,我们大规模系统地比较了两种自标注方法与使用上下文元数据的弱监督预训练方法。针对荷兰语和罗马尼亚语,我们分别利用27000和58000小时无标注音频,在混合、仅编码器CTC架构以及编码器-解码器语音识别系统上研究了帧级与序列级蒸馏方法。尽管所有方法相较各自基线词错率(WER)均提升超过8%,但编码器-解码器模型的序列级蒸馏相较最强数据增强监督基线带来了最大的20%相对词错率下降。
引用
@article{arxiv.2005.07850,
title = {Large scale weakly and semi-supervised learning for low-resource video ASR},
author = {Kritika Singh and Vimal Manohar and Alex Xiao and Sergey Edunov and Ross Girshick and Vitaliy Liptchinsky and Christian Fuegen and Yatharth Saraf and Geoffrey Zweig and Abdelrahman Mohamed},
journal= {arXiv preprint arXiv:2005.07850},
year = {2020}
}