说话者解耦的远程语音哮喘和慢性阻塞性肺疾病(COPD)急性期检测
声音
2026-05-19 v1
摘要
及早检测哮喘和慢性阻塞性肺疾病(COPD)急性期对于及时干预至关重要。语音信号作为一种有前景的持续、非侵入性的呼吸疾病监测工具已逐渐出现。然而,语音信号本身携带着说话者可识别属性,这些属性可能主导模型预测,从而可能损害诊断性能和患者隐私。此外,与呼吸疾病和说话者身份相关的声学特征在呼吸疾病监测中仍不明确。我们提出了一个对抗学习架构,用于从说话者可识别属性中解耦出与疾病相关的声学模式。该框架优化两个临床分层任务:(i)呼吸状态分类(稳定 vs. 急性期),(ii)急性期类型分类(哮喘急性期 vs. COPD急性期)。通过基于梯度反转的对抗训练抑制说话者身份。为了增强临床可解释性,我们采用SHapley Additive exPlanations(SHAP)来量化声学特征对与疾病相关的预测与说话者身份之间的贡献。在TACTICAS数据集上,我们的方法在两个任务上均优于单任务基线。对于呼吸状态任务(稳定 vs. 急性期),AUC从0.897提升至0.910。对于急性期类型任务(哮喘急性期 vs. COPD急性期),AUC从0.674提升至0.793。同时,J比值下降,证明有效抑制了说话者信息。SHAP分析揭示了声学特征对两个任务的贡献。在Bridge2AI-Voice数据集上的外部验证进一步表明性能提升一致且说话者依赖性降低,确认跨数据集的泛化性。
引用
@article{arxiv.2605.16878,
title = {Speaker-Disentangled Remote Speech Detection of Asthma and COPD Exacerbations},
author = {Yuyang Yan and Sami O. Simons and Visara Urovi},
journal= {arXiv preprint arXiv:2605.16878},
year = {2026}
}