基于语音信号的无监督实例判别学习用于抑郁症检测
音频与语音处理
2022-06-28 v1 定量方法
摘要
重度抑郁症(MDD)是一种影响数百万人的严重疾病,尽早诊断该障碍至关重要。从语音信号中检测抑郁症可对医生提供很大帮助,且无需任何侵入性操作即可完成。由于相关标注数据稀缺,我们提出了一种改进的无监督预训练技术——实例判别学习(IDL)方法,以提取增强不变且实例分散的嵌入表示。在学习增强不变嵌入方面,研究了多种语音数据增强方法,其中时间掩码(time-masking)取得了最佳性能。为学习实例分散嵌入,我们探索了训练批次中实例采样的方法(基于不同说话人与随机采样)。研究发现基于不同说话人的采样比随机采样性能更好,我们推测该结果是因为相关说话人信息被保留在嵌入中。此外,我们提出了一种基于聚类算法的新型采样策略——伪实例采样(PIS),以增强嵌入的分散特性。实验在 DAIC-WOZ(英文)和 CONVERGE(普通话)数据集上使用 DepAudioNet 进行,观察到使用 PIS 进行 MDD 检测相对于无预训练基线分别取得了统计显著性提升(p值分别为 0.0015 和 0.05)。
引用
@article{arxiv.2206.13016,
title = {Unsupervised Instance Discriminative Learning for Depression Detection from Speech Signals},
author = {Jinhan Wang and Vijay Ravi and Jonathan Flint and Abeer Alwan},
journal= {arXiv preprint arXiv:2206.13016},
year = {2022}
}