中文

自监督声学表征中的偏差与公平性:用于认知功能障碍检测

音频与语音处理 2026-03-04 v1 机器学习

摘要

基于语音的认知功能障碍(CI)检测提供了一种有前景的非侵入性早期诊断方法,但跨人口学和临床子群体的性能差异仍未充分探讨,引发公平性和可解释性的担忧。本研究对基于声学的CI和抑郁分类进行系统性偏差分析,使用DementiaBank Pitt语料库。我们比较传统声学特征(MFCCs、eGeMAPS)与Wav2Vec 2.0(W2V2)中的上下文化语音嵌入,并在性别、年龄和抑郁状态子群体中评估分类性能。对于CI检测,更高层次的W2V2嵌入优于基线特征(UAR最高可达80.6%),但表现出性能差异;具体而言,女性和年轻参与者显示出较低的判别能力(AUCAUC: 0.769和0.746)和显著的特异性差异(Δspec\Delta_{spec}最高可达18%和15%),导致其检测结果不如其同龄人。这些差异反映了表征性偏差,即跨人口学或临床子群体模型性能的系统性差异。在CI患者中的抑郁检测表现总体较差,尽管来自低层和中层W2V2的性能在轻度和中度层面有所改善。在CI和抑郁分类之间进行跨任务推理有限,表明每个任务依赖于不同的表征。这些发现强调了在临床语音应用中需要进行公平性意识的模型评估和子群体特定分析,尤其是在现实世界应用中考虑到人口学和临床异质性。

关键词

引用

@article{arxiv.2603.02937,
  title  = {Bias and Fairness in Self-Supervised Acoustic Representations for Cognitive Impairment Detection},
  author = {Kashaf Gulzar and Korbinian Riedhammer and Elmar Nöth and Andreas K. Maier and Paula Andrea Pérez-Toro},
  journal= {arXiv preprint arXiv:2603.02937},
  year   = {2026}
}

备注

12 pages, 4 figures, 6 tables, Journal paper