中文

DEPA:用于抑郁症检测的自监督音频嵌入

人机交互 2021-10-29 v3 声音 音频与语音处理

摘要

过去几十年中抑郁症检测研究日益增多,其主要瓶颈之一是数据可用性有限与表示学习不足。近来,自监督学习在文本嵌入预训练上取得成功,并广泛运用于数据稀疏的相关任务,而基于自监督学习的预训练音频嵌入则鲜有研究。本文提出 DEPA,一种用于抑郁症检测的自监督预训练抑郁音频嵌入方法。采用编码器-解码器网络在域内抑郁数据集(DAIC 与 MDD)及域外(Switchboard、Alzheimer's)数据集上提取 DEPA。以 DEPA 作为在应答层级提取的音频嵌入,在下游任务上取得显著性能提升,并在稀疏数据集 DAIC 与大型重度抑郁症数据集(MDD)上进行了评估。本文不仅作为一种捕获应答层级表示用于抑郁症检测的崭新嵌入提取方法,更重要的是,它是在音频处理特定任务中对自监督学习的一次探索。

关键词

引用

@article{arxiv.1910.13028,
  title  = {DEPA: Self-Supervised Audio Embedding for Depression Detection},
  author = {Pingyue Zhang and Mengyue Wu and Heinrich Dinkel and Kai Yu},
  journal= {arXiv preprint arXiv:1910.13028},
  year   = {2021}
}