中文

融合心理学知识的大语言模型在语音抑郁症识别中的应用

人机交互 2025-08-27 v1 计算与语言

摘要

抑郁症日益受到公众讨论和 AI 研究的关注。尽管深度神经网络(DNN)已被用于识别,但其在现实世界中的有效性仍然不足。大语言模型(LLM)展现出强大潜力,但需要特定领域的微调,且在处理非文本线索时存在困难。由于抑郁症通常通过声调和行为而非显式文本来表达,仅依赖语言是不够的。如果不结合心理学专业知识,诊断准确性也会受损。为了解决这些局限性,据我们所知,我们首次将 LLM 应用于使用 DAIC-WOZ 数据集的多模态抑郁症检测。我们使用预训练模型 Wav2Vec 提取音频特征,并将其映射到基于文本的 LLM 以进行进一步处理。我们还提出了一种将心理学知识融入 LLM 以增强诊断性能的新策略,具体使用问答集向 LLM 授予授权知识。与相关原始论文提出的基准分数相比,我们的方法在平均绝对误差(MAE)和均方根误差(RMSE)上均取得了显著改善。代码可在 https://github.com/myxp-lyp/Depression-detection.git 获取

关键词

引用

@article{arxiv.2505.22863,
  title  = {Large Language Models for Depression Recognition in Spoken Language Integrating Psychological Knowledge},
  author = {Yupei Li and Shuaijie Shao and Manuel Milling and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2505.22863},
  year   = {2025}
}