基于原型的适应方法提高无认知障碍语音识别的效果
声音
2024-09-25 v1 计算与语言
音频与语音处理
摘要
无认知障碍语音识别(DSR)由于存在的说话人间的变异性,面临巨大的挑战,导致在应用于新的无认知障碍说话人时,DSR 模型的性能显著下降。传统的说话人适应方法通常涉及为每个说话人进行微调,但这种策略在获取大量数据并为受限用户收集数据方面成本高昂且不便。为此,我们提出了一种基于原型的方法,显著提高了对未见无认知障碍说话人的 DSR 性能,而无需进行额外的微调。我们的方法使用以 HuBERT 为基础的特征提取器生成每个单词的原型,这些原型封装了先前未见说话人的特征。这些原型作为分类的基础。此外,我们还采用了监督对比学习来细化特征提取。通过提高表征质量,我们进一步提高了 DSR 性能,实现了有效的个性化 DSR。我们在 https://github.com/NKU-HLT/PB-DSR 上发布了代码。
引用
@article{arxiv.2407.18461,
title = {Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation},
author = {Shiyao Wang and Shiwan Zhao and Jiaming Zhou and Aobo Kong and Yong Qin},
journal= {arXiv preprint arXiv:2407.18461},
year = {2024}
}
备注
accepted by Interspeech 2024