中文

差分隐私在保护患者数据的同时实现公平且准确的基于 AI 的语音障碍分析

机器学习 2025-11-06 v3 人工智能 密码学与安全 声音 音频与语音处理

摘要

言语病理学对沟通能力和生活质量产生影响。虽然基于深度学习的模型在诊断这些障碍方面展现出潜力,但敏感数据的使用引发了关键的隐私问题。尽管差分隐私(DP)已在医学影像领域得到探索,但尽管存在同样关键的隐私问题,其在病理语音分析中的应用在很大程度上仍未被探索。据我们所知,本研究是首个调查 DP 对病理语音数据影响的研究,重点关注隐私、诊断准确性和公平性之间的权衡。使用包含来自 2,839 名德语参与者 200 小时录音的大型真实世界数据集,我们观察到在具有高隐私级别的 DP 下训练时,最大准确率下降了 3.85%。为突出真实世界的隐私风险,我们展示了非隐私模型对梯度反演攻击的脆弱性,重构了可识别的语音样本,并展示了 DP 在缓解这些风险方面的有效性。为探索跨语言和跨障碍的潜在泛化能力,我们在一个西班牙语帕金森病患者数据集上验证了我们的方法,利用来自健康英语数据集的预训练模型,并证明在 DP 约束下,在大规模任务特定数据集上的仔细预训练可以保持良好的准确率。一项全面的公平性分析揭示了在合理的隐私级别下性别偏见极小,但强调了解决与年龄相关的差异的必要性。我们的结果表明,DP 可以在语音障碍检测中平衡隐私和效用,同时突出了语音数据在隐私-公平性权衡方面的独特挑战。这为改进 DP 方法论和提高真实世界部署中不同患者群体的公平性奠定了基础。

关键词

引用

@article{arxiv.2409.19078,
  title  = {Differential privacy enables fair and accurate AI-based analysis of speech disorders while protecting patient data},
  author = {Soroosh Tayebi Arasteh and Mahshad Lotfinia and Paula Andrea Perez-Toro and Tomas Arias-Vergara and Mahtab Ranji and Juan Rafael Orozco-Arroyave and Maria Schuster and Andreas Maier and Seung Hee Yang},
  journal= {arXiv preprint arXiv:2409.19078},
  year   = {2025}
}