自监督语音识别中用于高效微调的代表性子集选择
机器学习
2023-04-13 v3 声音
音频与语音处理
摘要
自监督语音识别模型需要大量标注训练数据以学习用于自动语音识别(ASR)的高保真表示,这在计算上代价高昂且耗时。我们考虑在自监督语音模型中为 ASR 高效微调而识别最优数据子集的任务。我们发现,视觉任务中用于采样最具信息量样本的剪枝策略,在微调自监督 ASR 时表现并不优于随机子集选择。随后我们提出 COWERAGE 算法,用于自监督 ASR 中的代表性子集选择。COWERAGE 基于我们的发现:在早期训练轮次中依据训练词错误率(WER)确保样本覆盖可带来更好的泛化性能。在 TIMIT、Librispeech 与 LJSpeech 数据集上利用 wav2vec 2.0 与 HuBERT 模型开展的广泛实验表明了 COWERAGE 的有效性及其跨模型的可迁移性,相较现有数据集剪枝方法与随机采样取得了最高 17% 的相对 WER 提升。我们还证明,以 WER 值衡量的训练样本覆盖可确保纳入音素多样化的样本,从而提升自监督语音识别模型的测试准确率。
引用
@article{arxiv.2203.09829,
title = {Representative Subset Selection for Efficient Fine-Tuning in Self-Supervised Speech Recognition},
author = {Abdul Hameed Azeemi and Ihsan Ayyub Qazi and Agha Ali Raza},
journal= {arXiv preprint arXiv:2203.09829},
year = {2023}
}
备注
16 pages, 8 figures