面向真实场景的语音障碍分类
音频与语音处理
2023-04-27 v3 声音
摘要
目的:语音障碍严重损害个体日常生活中的说话能力。若缺乏早期诊断和治疗,这些障碍可能急剧恶化。因此,对于无法接受临床疾病评估的人群,家庭自动分类系统十分必要。然而,由于资源受限以及临床数据与含噪真实世界数据之间的领域失配,此类系统的性能可能下降。方法:本研究开发了一种紧凑且领域鲁棒的语音障碍分类系统,用于识别健康、肿瘤及良性结构性疾病的话语。我们所提出的系统利用由分解卷积神经网络组成的特征提取器模型,随后采用领域对抗训练,通过提取领域不变特征来消除领域失配。结果:结果表明,在含噪真实世界领域中的未加权平均召回率提升了13%,在临床领域仅轻微退化并保持在80%。领域失配被有效消除。此外,所提系统将内存与计算使用量均减少了超过73.9%。结论:通过部署分解卷积神经网络和领域对抗训练,可在资源受限情况下为语音障碍分类提取领域不变特征。令人鼓舞的结果证实,所提系统通过考虑领域失配,能显著降低资源消耗并提升分类准确率。意义:据我们所知,这是首项在语音障碍分类中同时考虑真实世界模型压缩与噪声鲁棒性问题的研究。所提系统旨在应用于资源受限的嵌入式系统。
引用
@article{arxiv.2112.02538,
title = {Toward Real-World Voice Disorder Classification},
author = {Heng-Cheng Kuo and Yu-Peng Hsieh and Huan-Hsin Tseng and Chi-Te Wang and Shih-Hau Fang and Yu Tsao},
journal= {arXiv preprint arXiv:2112.02538},
year = {2023}
}
备注
Accepted by IEEE TBME (under an IEEE Open Access publishing Agreement)