焦虑检测模型具有泛化能力吗?一项使用可穿戴设备的跨活动与跨人群研究
信号处理
2025-04-08 v1 人工智能
机器学习
摘要
引发焦虑的活动(如公开演讲)会触发焦虑症个体的高强度焦虑反应。近期研究表明,通过可穿戴设备采集的生理信号(包括心电图(ECG)和皮电活动(EDA))可通过机器学习模型用于检测此类情境下的焦虑。然而,这些焦虑预测模型在不同活动和不同人群中的泛化能力仍未得到充分探索——这是评估模型偏差和在更广泛应用中培养用户信任的关键步骤。为了填补这一空白,我们开展了一项有 111 名参与者参与的研究,他们参与了三项引发焦虑的活动。利用我们收集的数据集和两个知名的公开数据集,我们评估了焦虑检测模型在参与者内部(包括同活动和跨活动场景)以及跨参与者(活动内和跨活动)的泛化能力。我们总共训练并测试了超过 3348 个焦虑检测模型(使用了 6 种分类器、31 种特征集和 18 种训练-测试配置)。结果表明,三项关键指标——AUROC、焦虑状态召回率和非焦虑状态召回率——略高于 0.5 的基线分数。最佳 AUROC 分数介于 0.62 到 0.73 之间,焦虑类别的召回率跨度为 35.19% 到 74.3%。有趣的是,尽管焦虑类别的召回率确实表现出一定变化,但模型性能(以 AUROC 衡量)在不同活动和参与者群体之间保持相对稳定。
引用
@article{arxiv.2504.03695,
title = {Are Anxiety Detection Models Generalizable? A Cross-Activity and Cross-Population Study Using Wearables},
author = {Nilesh Kumar Sahu and Snehil Gupta and Haroon R Lone},
journal= {arXiv preprint arXiv:2504.03695},
year = {2025}
}