面向 ASR 的对比半监督学习
计算与语言
2021-03-10 v1
摘要
伪标签是预训练自动语音识别(ASR)模型最被广泛采用的方法。然而,其性能在低资源设定与域迁移下会因有监督教师模型质量下降而受损。受对比表示学习在计算机视觉与语音应用中的成功,以及近期在视觉对象有监督学习中的成功的启发,我们提出对比半监督学习(CSL)。CSL 避免直接预测教师生成的伪标签,转而利用它们来选取正例与负例。在转写公共社交媒体视频这一挑战性任务中,当使用 10 小时有监督数据标注 75,000 小时视频时,相较标准交叉熵伪标签(CE-PL),使用 CSL 将词错率(WER)降低了 8%。在仅用 1 小时标签进行教师监督的超低资源条件下,WER 降低幅度跃升至 19%。CSL 在域外条件下泛化性好得多,相较最佳的 CE-PL 预训练模型显示出最高 17% 的 WER 降低。
引用
@article{arxiv.2103.05149,
title = {Contrastive Semi-supervised Learning for ASR},
author = {Alex Xiao and Christian Fuegen and Abdelrahman Mohamed},
journal= {arXiv preprint arXiv:2103.05149},
year = {2021}
}