中文

基于语音语料库散度的无监督ASR数据选择

计算与语言 2023-02-28 v1 声音 音频与语音处理

摘要

选择与应用场景匹配的数据对于自动语音识别(ASR)训练十分重要,但训练语料库的匹配程度难以度量。本研究提出一种基于语音语料库散度(SCD)的无监督目标感知数据选择方法,该方法可度量两个语音语料库之间的相似度。我们首先使用自监督Hubert模型将语音语料库离散化为标签序列并计算N-gram概率分布;随后计算N-gram之间的Kullback-Leibler散度作为SCD;最后,我们选择与目标语料库SCD最小的数据子集进行标注与训练。相较于以往的数据选择方法,SCD数据选择方法能关注更多声学细节并保证所选集合的多样性。我们在Common Voice的不同口音上评估了该方法。实验表明,所提出的SCD数据选择相较随机选择实现了14.8%的相对提升,可与有监督选择结果相媲美甚至更优。

关键词

引用

@article{arxiv.2302.13222,
  title  = {Speech Corpora Divergence Based Unsupervised Data Selection for ASR},
  author = {Changfeng Gao and Gaofeng Cheng and Pengyuan Zhang and Yonghong Yan},
  journal= {arXiv preprint arXiv:2302.13222},
  year   = {2023}
}