中文

自监督表征在基于语音的抑郁检测中的应用

计算与语言 2023-07-07 v2 声音 音频与语音处理

摘要

本文提出利用经自监督学习(SSL)预训练的基础模型来处理基于语音的自动抑郁检测(SDD)中的训练数据稀疏问题。首先针对 SDD 分析了自预训练基础模型不同层提取的 SSL 表征,为合适的抑郁检测指示特征提供洞见。随后通过微调基础模型,将自动语音识别(ASR)与情感识别的知识迁移至 SDD。结果表明,当 ASR 模型的隐藏表征与 ASR 文本信息一并融入时,使用真实转录与 ASR 转录所得的 SDD 性能相近。通过融合多个基础模型的表征,我们在 DAIC-WOZ 数据集上取得了基于真实 ASR 的当前最优 SDD 结果。

关键词

引用

@article{arxiv.2305.12263,
  title  = {Self-supervised representations in speech-based depression detection},
  author = {Wen Wu and Chao Zhang and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2305.12263},
  year   = {2023}
}