中文

通过说话人解耦在抑郁症检测中保护说话人身份的一步探索

音频与语音处理 2023-06-08 v2 定量方法

摘要

在基于语音的自动心理健康障碍诊断中,保护患者身份是一项挑战。本文通过提出抑郁症特征与说话人身份的对抗性解耦来解决这一问题。用于抑郁症分类的模型以说话人身份不变的方式进行训练,在训练过程中最小化抑郁症预测损失并最大化说话人预测损失。该方法在两个数据集——DAIC-WOZ(英语)和CONVERGE(普通话)上,使用三种特征集(梅尔频谱图、原始音频信号和Wav2vec2.0的最后一层隐藏状态),并采用改进的DepAudioNet模型,验证了其有效性。与基线相比,采用对抗训练后,每种特征的抑郁症分类性能均有所提升。结合对抗学习的Wav2vec2.0特征取得了最佳性能(DAIC-WOZ的F1分数为69.2%,CONVERGE为91.5%)。对DepAudioNet模型隐藏状态的类别可分性度量(J-ratio)分析表明,应用对抗学习时,后端模型会丧失部分说话人区分能力,同时提升抑郁症区分能力。这些结果表明,说话人身份的某些成分可能对抑郁症检测无用,最小化其影响能提供更准确的潜在障碍诊断,并能保护说话人身份。

关键词

引用

@article{arxiv.2206.09530,
  title  = {A Step Towards Preserving Speakers' Identity While Detecting Depression Via Speaker Disentanglement},
  author = {Vijay Ravi and Jinhan Wang and Jonathan Flint and Abeer Alwan},
  journal= {arXiv preprint arXiv:2206.09530},
  year   = {2023}
}

备注

Accepted to Interspeech 2022