基于层次自监督表示学习的抑郁语音检测
计算与语言
2026-01-22 v2 人工智能
声音
音频与语音处理
摘要
语音抑郁检测(Speech-based Depression Detection, SDD)作为一种非侵入且可扩展的临床评估替代方案日益受到关注。然而,现有方法仍难以捕获稀疏且异质的抑郁相关语音特征。虽然预训练的自监督学习(Self-Supervised Learning, SSL)模型提供了丰富的表征,但近期的 SDD 研究大多仅从预训练 SSL 模型的单一层提取特征供下游分类器使用,这种做法忽略了低层声学特征与高层语义信息在不同 SSL 模型层中所承担的互补作用。为显式建模语音单元内声学与语义表征之间的相互作用,我们提出了一种层次自适应表示编码器,运用先验知识通过非对称跨注意力机制解耦并重新对齐声学与语义信息,从而使细粒度的声学模式能够在语义语境中得到解释。此外,引入联合连续特征分类(Connectionist Temporal Classification, CTC)目标作为辅助监督,用于处理抑郁特征在时间轴上的不规则分布,无需帧级标注。在 DAIC-WOZ 和 MODMA 数据集上进行的实验表明,HAREN-CTC 在性能上限评估和泛化评估两种情境下均一致优于现有方法,在上限评估中实现了0.81和0.82的宏平均F1分数,并在严格的交叉验证下保持优异性能,显著提升了精确率和AUC。这些发现表明,建模层次声学-语义相互作用更能反映抑郁特征在自然语音中的呈现方式,实现了可扩展且客观的抑郁评估。
引用
@article{arxiv.2510.08593,
title = {Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech},
author = {Yuxin Li and Eng Siong Chng and Cuntai Guan},
journal= {arXiv preprint arXiv:2510.08593},
year = {2026}
}