MLlm-DR:面向可解释抑郁症识别的多模态大语言模型
人工智能
2026-03-19 v2
摘要
自动化抑郁症诊断旨在分析来自访谈视频的多模态信息,以预测参与者的抑郁评分。以往的研究通常缺乏对这些评分如何确定的清晰解释,限制了其在临床实践中的应用。虽然大语言模型(LLMs)的出现为可解释的抑郁症诊断提供了可能的途径,但目前能够处理多模态数据的LLMs缺乏针对访谈数据的训练,导致直接使用时诊断性能不佳。在本文中,我们提出了一种新颖的多模态大语言模型(MLlm-DR),它能够理解多模态信息输入并支持可解释的抑郁症诊断。MLlm-DR集成了一个较小的LLM和一个轻量级查询模块(LQ-former)。具体来说,较小的LLM被设计用于生成抑郁评分和相应的评估理由。为了增强其在特定领域任务上的逻辑推理能力,同时保持实用性,我们构建了一个稳健的训练数据集对其进行微调。同时,LQ-former从语音和视觉数据中捕获与抑郁相关的特征,辅助模型处理多模态信息的能力,以实现全面的抑郁症诊断。我们的方法在两个基于访谈的基准数据集CMDC和E-DAIC-WOZ上取得了最先进的结果,证明了其有效性和优越性。
引用
@article{arxiv.2507.05591,
title = {MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models},
author = {Wei Zhang and Juan Chen and En Zhu and Wenhong Cheng and YunPeng Li and Yanbo J. Wang},
journal= {arXiv preprint arXiv:2507.05591},
year = {2026}
}