可复现的基于机器学习的语音病理检测:引入音高差异特征
微分几何
2024-10-15 v1
摘要
目的:我们引入一种 novel 方法,用于使用公开可用的 Saarbrucken Voice Database (SVD) 和 robust feature 集组合来检测语音病理,包括两种 novel 特征:音高差 (fundamental frequency 的相对变化) 和 NaN feature (fundamental frequency 估计失败)。方法:我们评估了六种机器学习 (ML) 算法——支持向量机、k 近邻、朴素贝叶斯、决策树、随机森林和 AdaBoost——使用网格搜索寻找可行的超参数,并测试 20480 种不同的 feature 子集组合。通过重复分层交叉验证验证前 1000 个分类模型——每个 ML 算法的 feature 子集组合。为解决类别不平衡问题,我们应用 K-Means SMOTE 来增强训练数据。结果:我们的做法在女性、男性和合并结果下分别实现了 85.61%、84.69% 和 85.22% 的 unweighted average recall (UAR)。我们刻意省略准确率,因为它是不平衡数据的高度偏置指标。结论:我们的研究表明,遵循所提出的方法和 feature 工程,在应用到最简单的声带任务——持续元音 /a:/ 的持续发音——方面,存在使用 ML 模型检测各种语音病理的潜力。为便于使用我们的方法并支持我们的主张,我们提供了一个公开可用的 GitHub 存储库,DOI 为 10.5281/zenodo.13771573。最后,我们提供 REFORMS 检查表来增强可读性、可复现性和我们方法的合理性。
引用
@article{arxiv.2410.10536,
title = {Three-dimensional Lie algebras admitting regular semisimple algebraic Nijenhuis operators},
author = {Zhikhareva Ekaterina Sergeevna},
journal= {arXiv preprint arXiv:2410.10536},
year = {2024}
}