基于对比损失比的无监督语音识别数据选择方法
音频与语音处理
2022-07-26 v1 声音
摘要
本文提出一种无监督数据选择方法,利用基于目标数据集与训练数据集对比损失比的次模函数。在两组数据上训练一个使用对比损失函数的模型,然后由次模函数使用每个模型的帧级损失之比。通过次模函数,选出与目标数据集匹配的自动语音识别训练集。实验表明,在词错误率(WER)方面,用所提方法选出的数据集训练的模型优于基于 GMM-HMM 模型产生的对数似然的选择方法。当选择固定数量(如 10 小时数据)时,两种方法在 Tedtalks 上的结果相对差异为 20.23% WER。该方法也可用于以最小化负迁移为目标选择数据,同时保持或提升在整个训练集上训练所得模型的性能。结果表明,从整个数据集中选择 85% 时,WSJCAM0 数据集上的 WER 相对降低了 6.26%。
引用
@article{arxiv.2207.12028,
title = {Unsupervised data selection for Speech Recognition with contrastive loss ratios},
author = {Chanho Park and Rehan Ahmad and Thomas Hain},
journal= {arXiv preprint arXiv:2207.12028},
year = {2022}
}
备注
5 pages, accepted by ICASSP 2022