基于语音语料库散度的无监督ASR数据选择
计算与语言
2023-02-28 v1 声音
音频与语音处理
摘要
选择与应用场景匹配的数据对于自动语音识别(ASR)训练十分重要,但训练语料库的匹配程度难以度量。本研究提出一种基于语音语料库散度(SCD)的无监督目标感知数据选择方法,该方法可度量两个语音语料库之间的相似度。我们首先使用自监督Hubert模型将语音语料库离散化为标签序列并计算N-gram概率分布;随后计算N-gram之间的Kullback-Leibler散度作为SCD;最后,我们选择与目标语料库SCD最小的数据子集进行标注与训练。相较于以往的数据选择方法,SCD数据选择方法能关注更多声学细节并保证所选集合的多样性。我们在Common Voice的不同口音上评估了该方法。实验表明,所提出的SCD数据选择相较随机选择实现了14.8%的相对提升,可与有监督选择结果相媲美甚至更优。
引用
@article{arxiv.2302.13222,
title = {Speech Corpora Divergence Based Unsupervised Data Selection for ASR},
author = {Changfeng Gao and Gaofeng Cheng and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:2302.13222},
year = {2023}
}