面向言语、语言与听力学中可泛化机器学习模型:样本量估计与过拟合缓解
机器学习
2024-03-19 v3
摘要
本研究的首要目的是提供定量证据,以激励研究者改用更稳健的嵌套交叉验证方法。第二个目的是在研究设计阶段,给出基于机器学习的分析进行功效分析的方法与MATLAB代码。我们采用蒙特卡洛模拟来量化所采用的交叉验证方法、特征的判别力、特征空间维度以及模型维度之间的相互作用。基于机器学习模型的统计功效与统计置信度,比较了四种交叉验证(单次留出、10折、训练-验证-测试、嵌套10折)。利用原假设与备择假设的分布来确定获得统计显著结果(α=0.05,1-β=0.8)所需的最小样本量。模型的统计置信度定义为正确特征被选中并纳入最终模型的概率。我们的分析表明,基于单次留出方法生成的模型统计功效与统计置信度极低,且显著高估了准确率。相反,嵌套10折交叉验证获得了最高的统计置信度与最高的统计功效,同时提供了无偏的准确率估计。采用单次留出所需的样本量可能比使用嵌套交叉验证时高出50%。基于嵌套交叉验证的模型置信度最高可达基于单次留出模型的四倍。我们提供了计算模型、MATLAB代码与查找表,以协助研究者在未来研究设计中估计样本量。
引用
@article{arxiv.2308.11197,
title = {Toward Generalizable Machine Learning Models in Speech, Language, and Hearing Sciences: Estimating Sample Size and Reducing Overfitting},
author = {Hamzeh Ghasemzadeh and Robert E. Hillman and Daryush D. Mehta},
journal= {arXiv preprint arXiv:2308.11197},
year = {2024}
}
备注
Accepted at JSLHR