中文

面向原始语音信号抑郁检测的非均匀说话人解耦

音频与语音处理 2023-06-07 v2

摘要

尽管利用说话人身份特征(如说话人嵌入)的基于语音的抑郁检测方法很流行,但它们往往损害患者隐私。为解决此问题,我们提出了一种说话人解耦方法,其利用对抗性说话人识别(SID)损失最大化的非均匀机制。这是通过在训练期间改变模型不同层之间的对抗权重来实现的。我们发现,初始层具有更大的对抗权重可带来性能提升。我们使用 ECAPA-TDNN 模型的方法在 DAIC-WoZ 数据集上取得了 0.7349 的 F1 分数(比仅音频的 SOTA 提升 3.7%),同时将说话人识别准确率降低了 50%。我们的研究结果表明,通过语音信号识别抑郁可以在不过度依赖说话人身份的情况下完成,为隐私保护的抑郁检测方法铺平了道路。

关键词

引用

@article{arxiv.2306.01861,
  title  = {Non-uniform Speaker Disentanglement For Depression Detection From Raw Speech Signals},
  author = {Jinhan Wang and Vijay Ravi and Abeer Alwan},
  journal= {arXiv preprint arXiv:2306.01861},
  year   = {2023}
}

备注

Accepted to Interspeech 2023