中文

DepFlow:消除抑郁检测中语义偏差的解耦语音生成

计算与语言 2026-01-05 v1 人工智能

摘要

语音是早期精神健康筛查的可扩展且非侵入性生物标志物。然而,广泛使用的抑郁数据集如 DAIC-WOZ 在语言情感与诊断标签之间存在强烈的耦合,鼓励模型学习语义捷径。结果是模型在现实场景(如伪装性抑郁)中可能丧失鲁棒性——在这种情况下,个体虽然潜在抑郁,却维持社会积极或中性语言。为缓解这种语义偏差,我们提出了 DepFlow,一个三阶段的抑郁条件文本到语音框架。第一阶段,抑郁声学编码器通过对抗训练学习听者和内容不变的抑郁嵌入,实现有效的解耦,同时保持抑郁可区分性(ROC-AUC: 0.693)。第二阶段,采用 FiLM 调制注入这些嵌入的流匹配语音合成模型,使其能够在保持内容和说话人身份的同时控制抑郁严重程度。第三阶段,基于原型的严重程度映射机制提供了在抑郁连续体上的平滑且可解释的操控。使用 DepFlow,我们构建了一个以伪装性抑郁为导向的增强数据集(CDoA),将抑郁声学模式与来自情感分层文本库的积极/中性内容配对,形成声学-语义不匹配,这在自然数据中相对不足。经过评估,CDoA 在三种抑郁检测架构中分别将宏平均 F1 分数提高了 9%、12% 和 5%,始终优于传统增强策略。除了增强鲁棒性,DepFlow 提供了一个可控的合成平台,用于对话系统和仿真评估,而临床数据受限于伦理和覆盖范围。

关键词

引用

@article{arxiv.2601.00303,
  title  = {DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection},
  author = {Yuxin Li and Xiangyu Zhang and Yifei Li and Zhiwei Guo and Haoyang Zhang and Eng Siong Chng and Cuntai Guan},
  journal= {arXiv preprint arXiv:2601.00303},
  year   = {2026}
}