优化MFCC参数以实现呼吸系统疾病的自动检测
声音
2026-05-11 v2 机器学习
音频与语音处理
摘要
源自呼吸道的语音信号被用作诊断和评估呼吸系统疾病的宝贵声学生物标志物。在所使用的声学特征中,梅尔频率倒谱系数(MFCC)被广泛用于自动分析,其提取通常依赖默认参数。然而,尚无全面研究系统地探讨MFCC提取参数对呼吸系统疾病诊断的影响。在本研究中,我们通过考察关键参数(即系数数量、帧长和帧间跳跃长度)对呼吸状况检查的影响来填补这一空白。我们的研究使用了四个数据集:剑桥COVID-19声音数据库、Coswara数据集、萨尔布吕肯语音障碍(SVD)数据库和一个TACTICAS数据集。鉴于其广泛采用和有效性,采用支持向量机(SVM)作为分类器。我们的研究结果表明,MFCC的准确率随跳跃长度增加而下降,观察到的最佳系数数量约为30。MFCC的性能在不同数据集上随帧长变化:对于COVID-19数据集(剑桥COVID-19声音数据库和Coswara数据集),性能随帧长增加而下降;而对于SVD数据集,性能随帧长增加(从50毫秒到500毫秒)而提升。此外,我们研究了这些参数的优化组合,并观察到准确率有显著提升。与最差组合相比,SVM模型在剑桥COVID-19声音数据库、Coswara数据集和SVD数据集上分别达到了81.1%、80.6%和71.7%的准确率,分别提升了19.6%、16.10%和14.90%。
引用
@article{arxiv.2408.07522,
title = {Optimising MFCC parameters for the automatic detection of respiratory diseases},
author = {Yuyang Yan and Sami O. Simons and Loes van Bemmel and Lauren Reinders and Frits M. E. Franssen and Visara Urovi},
journal= {arXiv preprint arXiv:2408.07522},
year = {2026}
}