中文

通过结合低层描述符与基础模型表示实现病态嗓音的鲁棒评估

声音 2025-12-12 v4 机器学习 音频与语音处理

摘要

感知嗓音质量评估在嗓音障碍的诊断与监测中起着至关重要的作用。传统方法,如嗓音共识听觉感知评估 (CAPE-V) 和 GRBAS(嘶哑度、粗糙度、气息度、无力度、紧张度)量表,依赖于专家评分者且易受评分者间变异性的影响,凸显了对客观解决方案的需求。本研究引入了嗓音质量评估网络 (VOQANet),这是一种采用注意力机制与语音基础模型 (SFM) 嵌入来提取高层特征的深度学习框架。为进一步提升性能,我们提出了 VOQANet+,它将自监督 SFM 嵌入与低层声学描述符——即 jitter、shimmer 和谐噪比 (HNR)——相结合。与以往仅关注基于元音发声 (PVQD-A) 的方法不同,我们的模型在元音级和句子级语音 (PVQD-S) 上均进行了评估,以考察泛化能力。实验结果表明,基于句子的输入产生了更高的准确率,尤其是在患者级别。总体而言,VOQANet 在 CAPE-V 和 GRBAS 各维度的均方根误差 (RMSE) 和 Pearson 相关系数上始终优于基线模型,而 VOQANet+ 甚至取得了更大的性能提升。此外,VOQANet+ 在噪声条件下保持稳定的性能,表明其对真实世界与远程医疗应用具有增强的鲁棒性。这项工作突显了将 SFM 嵌入与低层特征相结合在准确且鲁棒的病态嗓音评估中的价值。

关键词

引用

@article{arxiv.2505.21356,
  title  = {Towards Robust Assessment of Pathological Voices via Combined Low-Level Descriptors and Foundation Model Representations},
  author = {Whenty Ariyanti and Kuan-Yu Chen and Sabato Marco Siniscalchi and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2505.21356},
  year   = {2025}
}