中文

基于文本和音视频模态的大语言模型抑郁检测与分析

人机交互 2024-12-03 v2 人工智能

摘要

抑郁已被证明是一 significant 的公共卫生问题,深刻影响个体的心理健康。若未被诊断,抑郁可能导致严重的健康问题,这些问题可在身体上表现,甚至导致自杀。一般而言,诊断抑郁或其他精神疾病涉及对半结构化访谈以及补充问卷的进行,包括临床医生和精神健康专业人员使用的患者健康问卷(PHQ)等变体。这一方法对执业医师和精神健康专业人员的经验和判断提出了 significant 依赖,使诊断容易受到个人偏见的影响。鉴于导致抑郁的 underlying 机制仍在积极研究中,医生们往往在临床表现为早期时面临诊断和治疗的挑战。最近,在人工神经计算中取得显著进展,以解决涉及文本、图像和语音的问题在 various 领域。我们的分析旨在利用这些 state-of-the-art(SOTA)模型在我们的实验中实现最佳结果,利用 multiple 模态。实验是在Extended Distress Analysis Interview Corpus Wizard of Oz数据集(E-DAIC)corpus中进行的,presented in Audio/Visual Emotion Challenge(AVEC)2019挑战中。所提出的解决方案 demonstrate 更好的结果通过专有和开源的大语言模型(LLMs),在文本模态上实现了3.98的均方根误差(RMSE),超越了AVEC 2019挑战基线结果和当前 SOTA回归分析架构。此外,所提出的解决方案在分类任务中实现了71.43%的准确率。该论文还包括一个 novel audio-visual multi-modal network,用于预测PHQ-8得分,RMSE为6.51。

关键词

引用

@article{arxiv.2407.06125,
  title  = {Depression Detection and Analysis using Large Language Models on Textual and Audio-Visual Modalities},
  author = {Chayan Tank and Sarthak Pol and Vinayak Katoch and Shaina Mehta and Avinash Anand and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2407.06125},
  year   = {2024}
}

备注

12 pages, 9 figures, 9 tables