通过DSSCNet与跨语料库适应提升说话人无关型苍涩语音严重程度分类
音频与语音处理
2025-09-18 v1 声音
摘要
苍涩语音严重程度分类对于客观临床评估和监测具有动作语音障碍患者的进展至关重要。尽管先前方法已解决了这一任务,但在说话人无关(SID)场景中实现稳健的泛化仍具有挑战性。本文引入DSSCNet,一种新型深度神经网络架构,结合卷积、压缩激发(SE)和残差网络,帮助从mel频谱图中提取苍涩语音的判别性表征。SE模块的添加可选择性地聚焦于苍涩语音的重要特征,从而最小化损失并提升整体模型性能。我们还提出了一个源自检测基准迁移学习方法的跨语料库微调框架,用于严重程度分类。DSSCNet在两个基准苍涩语音语料库上进行评估:TORGO和UA-Speech,采用说话人无关评估协议:每个严重程度一个说话人(OSPS)和留出一个说话人(LOSO)协议。在TORGO和UA-Speech上的DSSCNet分别在OSPS和LOSO设置下分别实现了56.84%和62.62%的准确率,在LOSO设置下分别实现了63.47%和64.18%的准确率,显著优于现有的最先进方法。在微调后,性能得到显著提升,DSSCNet在OSPS下在TORGO上实现最高75.80%的准确率,在UA-Speech上实现68.25%,在LOSO下分别实现最高77.76%和79.44%。这些结果表明DSSCNet在不同苍涩语音数据集上实现面向细粒度严重程度分类的有效性和可泛化性。
引用
@article{arxiv.2509.13442,
title = {Enhancing Speaker-Independent Dysarthric Speech Severity Classification with DSSCNet and Cross-Corpus Adaptation},
author = {Arnab Kumar Roy and Hemant Kumar Kathania and Paban Sapkota},
journal= {arXiv preprint arXiv:2509.13442},
year = {2025}
}
备注
Speaker-independent experiments on classification of dysarthric speech severity