自监督表征在基于语音的抑郁检测中的应用
计算与语言
2023-07-07 v2 声音
音频与语音处理
摘要
本文提出利用经自监督学习(SSL)预训练的基础模型来处理基于语音的自动抑郁检测(SDD)中的训练数据稀疏问题。首先针对 SDD 分析了自预训练基础模型不同层提取的 SSL 表征,为合适的抑郁检测指示特征提供洞见。随后通过微调基础模型,将自动语音识别(ASR)与情感识别的知识迁移至 SDD。结果表明,当 ASR 模型的隐藏表征与 ASR 文本信息一并融入时,使用真实转录与 ASR 转录所得的 SDD 性能相近。通过融合多个基础模型的表征,我们在 DAIC-WOZ 数据集上取得了基于真实 ASR 的当前最优 SDD 结果。
引用
@article{arxiv.2305.12263,
title = {Self-supervised representations in speech-based depression detection},
author = {Wen Wu and Chao Zhang and Philip C. Woodland},
journal= {arXiv preprint arXiv:2305.12263},
year = {2023}
}