利用音标特定码本改进自监督预训练
计算与语言
2024-07-08 v1 人工智能
机器学习
声音
音频与语音处理
摘要
语音音标对最新端到端自动语音识别(ASR)系统的性能构成严重挑战。即使采用自监督学习和预训练方法,也很少实现语音音标的不变性。本文提出一种面向自监督学习的音标感知适应技术,引入一组可训练的音标特定码本于自监督架构中。这些可学习的码本使模型能够在预训练期间捕获音标特定信息,并在ASR微调进一步细化。在Mozilla Common Voice数据集上,我们的方法在所有seen和unseen英文音标上均优于其他所有音标适应方法,词错误率(WER)可降低最高9%。
引用
@article{arxiv.2407.03734,
title = {Improving Self-supervised Pre-training using Accent-Specific Codebooks},
author = {Darshan Prabhu and Abhishek Gupta and Omkar Nitsure and Preethi Jyothi and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2407.03734},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024