联合语音转写与翻译:基于分布外数据的伪标注
计算与语言
2022-12-21 v1 声音
音频与语音处理
摘要
自训练已被证明有助于解决包括视觉、语音和语言在内的许多领域的数据稀缺问题。具体而言,自训练或伪标注(pseudo-labeling)为无监督数据打上标签并加入训练池。在本工作中,我们研究并使用了伪标注用于一种近期提出的全新设定:语音的联合转写与翻译,该任务受制于缺乏充足的数据资源。我们表明,在此类数据匮乏情形下,无标签数据可能在域上与有监督数据存在显著差异,从而导致伪标注质量下降。我们研究了两类无需额外监督且针对域不匹配的 remedy:伪标注过滤与数据增强。我们表明,此类伪标注分析与处理在朴素伪标注设定之上带来额外收益,最终实现最高 0.6% 绝对 WER 与 2.2 BLEU 点的总体改进。
引用
@article{arxiv.2212.09982,
title = {Joint Speech Transcription and Translation: Pseudo-Labeling with Out-of-Distribution Data},
author = {Mozhdeh Gheini and Tatiana Likhomanenko and Matthias Sperber and Hendra Setiawan},
journal= {arXiv preprint arXiv:2212.09982},
year = {2022}
}