中文

面向可解释性的多模态抑郁动态摘要生成

人工智能 2026-04-14 v1

摘要

抑郁症因污名化和主观症状评估而导致诊断和治疗不足。为解决这一挑战,我们提出一种粗到细、多阶段框架,利用大语言模型(LLM)实现准确且可解释的检测。该管道执行二元筛查、五级严重程度分类和连续回归。在每个阶段,LLM会产生越来越丰富的临床摘要,以指导多模态融合模块整合文本、音频和视频特征,生成具有透明依据的预测。系统随后将所有摘要整合为简洁且易于人类理解的评估报告。在E-DAIC和CMDC数据集上实验,结果在准确率和可解释性方面均显著优于最先进的基线。

关键词

引用

@article{arxiv.2604.11334,
  title  = {Dynamic Summary Generation for Interpretable Multimodal Depression Detection},
  author = {Shiyu Teng and Jiaqing Liu and Hao Sun and Yu Li and Shurong Chai and Ruibo Hou and Tomoko Tateyama and Lanfen Lin and Yen-Wei Chen},
  journal= {arXiv preprint arXiv:2604.11334},
  year   = {2026}
}