MOPSA:基于提示专家混合的老年语音识别说话人自适应
音频与语音处理
2025-06-02 v1
摘要
本文提出了一种用于老年语音识别的新颖的基于提示专家混合的说话人自适应方法 (MOPSA)。该方法允许对未见过的说话人进行零样本、实时自适应,并利用针对老年说话人定制的领域知识。使用 K-means 算法导出的 Top-K 最具区分性的说话人提示簇作为专家。训练一个路由网络来动态组合聚类后的提示专家。使用 Whisper 的独立编码器和解码器提示对老年说话人之间的声学和语言级变异性进行建模。在英语 DementiaBank Pitt 和粤语 JCCOCC MoCA 老年语音数据集上的实验表明,在线 MOPSA 自适应优于非特定说话人 (SI) 模型,词错率 (WER) 或字错率 (CER) 绝对降低 0.86% 和 1.47%(相对降低 4.21% 和 5.40%),具有统计显著性。与离线批处理模式自适应相比,获得了高达 16.12 倍的实时率 (RTF) 加速比。
引用
@article{arxiv.2505.24224,
title = {MOPSA: Mixture of Prompt-Experts Based Speaker Adaptation for Elderly Speech Recognition},
author = {Chengxi Deng and Xurong Xie and Shujie Hu and Mengzhe Geng and Yicong Jiang and Jiankun Zhao and Jiajun Deng and Guinan Li and Youjun Chen and Huimeng Wang and Haoning Xu and Mingyu Cui and Xunying Liu},
journal= {arXiv preprint arXiv:2505.24224},
year = {2025}
}
备注
Accepted by Interspeech 2025