中文

谁在说话?谁正在抑郁?关于说话方式抑郁检测中说话人泄漏的受控研究

音频与语音处理 2026-04-17 v1

摘要

本研究探讨了基于语音的抑郁检测模型是否学习到抑郁相关的声学生物标志物,抑或依赖说话人身份线索进行判断。采用 DAIC-WOZ 数据集,我们提出了一种数据划分策略,通过控制训练集与测试集之间的说话人重叠度且保持训练规模不变,来评估三种复杂度不同的模型。结果表明,说话人重叠显著提升模型性能,而在未见说话人上的准确率却急剧下降。即便采用 Domain-Adversarial Neural Network,仍存在显著的性能差距。这些发现表明,当前语音模型提取的抑郁相关特征高度依赖于说话人身份。传统评估协议因此可能高估模型的泛化能力和临床实用性,凸显了严格的说话人独立评估的必要性。

关键词

引用

@article{arxiv.2604.14354,
  title  = {Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection},
  author = {Hsiang-Chen Yeh and Luqi Sun and Aurosweta Mahapatra and Shreeram Suresh Chandra and Emily Mower Provost and Berrak Sisman},
  journal= {arXiv preprint arXiv:2604.14354},
  year   = {2026}
}

备注

Submitted to Interspeech 2026