中文

通过掩码语言模型校正离散自监督语音单元实现无监督口音自适应

音频与语音处理 2025-02-06 v1 声音

摘要

自监督预训练语音模型已大幅改进语音识别,但它们仍对领域偏移及口音或非典型语音敏感。许多此类模型依赖量化或聚类来学习离散声学单元。我们提出以无监督方式将口音语音中发现的离散单元校正回标准发音。在来自标准口音的离散单元上训练掩码语言模型,并通过掩码异常聚类序列并预测其常见变体,迭代校正口音令牌序列。在预训练模型中插入小型口音适配器块,并通过预测校正后的聚类进行微调,从而提升预训练模型对目标口音的鲁棒性,且无需监督。我们能够通过用所提方法改变训练机制,在下游口音语音识别任务上改进最先进的 HuBERT Large 模型。

关键词

引用

@article{arxiv.2309.13994,
  title  = {Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units},
  author = {Jakob Poncelet and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2309.13994},
  year   = {2025}
}

备注

Submitted to ICASSP2024