中文

利用音频与文本多模态进行精神健康诊断:LLM 性能研究

计算与语言 2025-08-14 v2 人工智能 声音 音频与语音处理

摘要

精神健康障碍在全球范围内日益普及,迫切需要创新工具来支持早期诊断和干预。本研究探讨了大型语言模型(LLM)在多模态精神健康诊断中的潜力,具体用于通过文本和音频模态检测抑郁和创伤后应激障碍(PTSD)。我们使用 E-DAIC 数据集,对比文本和音频模态,探讨 LLM 是否能在仅凭音频输入的情况下表现更好。进一步检验两种模态的集成是否能提升诊断准确性,这通常会导致更好的性能指标。我们的分析特别使用了自定义的指标:模态优势得分(Modal Superiority Score)和不一致解决得分(Disagreement Resolvement Score),以评估组合模态对模型性能的影响。实验结果表明,Gemini 1.5 Pro 模型在使用组合模态进行二分类抑郁诊断时取得最高得分,F1 分数为 0.67,平衡准确率(BA)为 77.4%。这些结果比仅使用文本模态提升 3.1%,比仅使用音频模态提升 2.7%,突显了整合模态以提升诊断准确性的有效性。值得注意的是,所有结果都是在零样本推断下获得的,凸显了模型在无需任务特定微调的情况下的鲁棒性。为探讨不同配置对模型性能的影响,我们进行了二分类、严重程度分类和多分类任务,使用零样本和少样本提示,检验了提示变体对性能的影响。结果显示,Gemini 1.5 Pro 在文本和音频模态中,以及 GPT-4o mini 在文本模态中,往往在多个任务上的平衡准确率和 F1 分数均领先于其他模型。

关键词

引用

@article{arxiv.2412.10417,
  title  = {Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance},
  author = {Abdelrahman A. Ali and Aya E. Fouda and Radwa J. Hanafy and Mohammed E. Fouda},
  journal= {arXiv preprint arXiv:2412.10417},
  year   = {2025}
}