面向自动语音识别的双层联合无监督与监督训练
计算与语言
2024-12-12 v1
摘要
本文提出一种双层联合无监督与监督训练 (BL-JUST) 框架用于自动语音识别。与常用的预训练和微调策略(即不相连的两阶段过程)相比,BL-JUST 试图优化声学模型,使其同时最小化无监督与监督损失函数。由于 BL-JUST 寻求两者损失函数的匹配局部最优,声学模型学习的表征在通用性与任务特定性之间取得良好平衡。我们采用惩罚型双层梯度下降方法求解 BL-JUST 问题,并在多种数据集上评估了采用不同架构和损失函数的深度神经网络声学模型。我们表明 BL-JUST 可优于广泛使用的预训练和微调策略以及其他流行的半监督技术。
引用
@article{arxiv.2412.08548,
title = {Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition},
author = {Xiaodong Cui and A F M Saif and Songtao Lu and Lisha Chen and Tianyi Chen and Brian Kingsbury and George Saon},
journal= {arXiv preprint arXiv:2412.08548},
year = {2024}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing