面向原始语音信号抑郁检测的非均匀说话人解耦
音频与语音处理
2023-06-07 v2
摘要
尽管利用说话人身份特征(如说话人嵌入)的基于语音的抑郁检测方法很流行,但它们往往损害患者隐私。为解决此问题,我们提出了一种说话人解耦方法,其利用对抗性说话人识别(SID)损失最大化的非均匀机制。这是通过在训练期间改变模型不同层之间的对抗权重来实现的。我们发现,初始层具有更大的对抗权重可带来性能提升。我们使用 ECAPA-TDNN 模型的方法在 DAIC-WoZ 数据集上取得了 0.7349 的 F1 分数(比仅音频的 SOTA 提升 3.7%),同时将说话人识别准确率降低了 50%。我们的研究结果表明,通过语音信号识别抑郁可以在不过度依赖说话人身份的情况下完成,为隐私保护的抑郁检测方法铺平了道路。
引用
@article{arxiv.2306.01861,
title = {Non-uniform Speaker Disentanglement For Depression Detection From Raw Speech Signals},
author = {Jinhan Wang and Vijay Ravi and Abeer Alwan},
journal= {arXiv preprint arXiv:2306.01861},
year = {2023}
}
备注
Accepted to Interspeech 2023