中文

基于 CDSD 数据集的跨学习微调策略用于困语说话人识别

声音 2025-08-27 v1 人工智能

摘要

困语说话人识别面临严重程度差异和与正常语音的差异带来的挑战。传统方法会针对每个患者单独微调预训练于正常语音的语音识别模型,以防止特征冲突。但实验反常地显示,多说话人微调(同时在多个困语说话人上)会提高对单个语音模式的识别。这一策略通过更广泛的病理特征学习来增强泛化能力,减轻说话人特定的过拟合,减少对单位患者数据的依赖,并提高目标说话人的识别准确率——相对于单说话人微调可降低最高达 13.15% 的词错误率。

关键词

引用

@article{arxiv.2508.18732,
  title  = {Cross-Learning Fine-Tuning Strategy for Dysarthric Speech Recognition Via CDSD database},
  author = {Qing Xiao and Yingshan Peng and PeiPei Zhang},
  journal= {arXiv preprint arXiv:2508.18732},
  year   = {2025}
}