面向构音障碍语音识别的语音基础模型零样本 MoE 说话人自适应即时路由
声音
2025-05-29 v1 音频与语音处理
摘要
本文提出了一种新颖的基于混合专家的说话人自适应框架,用于基于基础模型的构音障碍语音识别。该方法在融入领域知识的同时,能够实现零样本自适应和实时处理。利用即时预测的说话人相关路由参数,动态组合受语音障碍严重程度和性别条件限制的适配器专家。使用 KL 散度进一步强制专家之间的多样性及其对未见说话人的泛化能力。在 UASpeech 语料库上的实验结果表明,与未自适应的基线 HuBERT/WavLM 模型相比,基于即时 MoE 的自适应产生了统计学上显著的词错率(WER)降低,最高达 1.34% 绝对值(6.36% 相对值)。在不同的说话人级数据量下,与批处理模式自适应相比,获得了高达 2.55% 绝对值(11.44% 相对值)的一致 WER 降低以及最高 7 倍的实时率(RTF)加速。获得了 16.35% 的最低已发表 WER(在极低可懂度下为 46.77%)。
引用
@article{arxiv.2505.22072,
title = {On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition},
author = {Shujie HU and Xurong Xie and Mengzhe Geng and Jiajun Deng and Huimeng Wang and Guinan Li and Chengxi Deng and Tianzi Wang and Mingyu Cui and Helen Meng and Xunying Liu},
journal= {arXiv preprint arXiv:2505.22072},
year = {2025}
}
备注
Accepted by Interspeech 2025