结合X-Vectors和贝叶斯批量主动学习:语音识别的两阶段主动学习流水线
音频与语音处理
2026-03-09 v2 人工智能
计算与语言
机器学习
摘要
本文介绍了一种新颖的两阶段主动学习(AL)流水线用于自动语音识别(ASR),结合了无监督和有监督的AL方法。第一阶段利用无监督AL,通过使用x-vectors聚类从未标记的语音数据中选择多样化的样本,从而为后续的有监督AL建立一个鲁棒的初始数据集。第二阶段引入了一种有监督的AL策略,采用专门为ASR开发的批量AL方法,旨在选择多样化和信息丰富的样本批次。这里,样本多样性也通过x-vectors聚类实现,而最具信息量的样本则通过一种针对ASR定制的贝叶斯AL方法识别,该方法采用蒙特卡洛丢弃的变体来近似贝叶斯推断。这种方法能够精确估计不确定性,从而在显著减少数据需求的情况下增强ASR模型训练。我们的方法在同质、异质和OOD测试集上均表现出优于竞争方法的性能,表明策略性样本选择和创新的贝叶斯建模可以显著优化基于深度学习的ASR应用中的标注工作和数据利用。
引用
@article{arxiv.2406.02566,
title = {Combining X-Vectors and Bayesian Batch Active Learning: Two-Stage Active Learning Pipeline for Speech Recognition},
author = {Ognjen Kundacina and Vladimir Vincan and Dragisa Miskovic},
journal= {arXiv preprint arXiv:2406.02566},
year = {2026}
}