中文

推理并非万能:审视多轮心理健康对话中的 LLM

计算与语言 2025-05-29 v2

摘要

心理健康医疗资源获取受限、等待时间漫长以及大型语言模型(LLM)能力日益增强,促使个人转向 LLM 以满足其心理健康需求。然而,对 LLM 多轮心理健康对话能力的考察仍不充分。现有评估框架通常关注诊断准确率与胜率,往往忽视了实现有意义对话所需的与患者特定目标、价值观及人格的对齐。为此,我们引入 MedAgent,一个用于合成生成逼真多轮心理健康意义建构对话的新框架,并利用它创建了心理健康意义建构对话(Mental Health Sensemaking Dialogue, MHSD)数据集,包含超过 2,200 段患者与 LLM 的对话。此外,我们提出 MultiSenseEval,一个使用以人为中心的准则评估医疗场景下 LLM 多轮对话能力的整体框架。我们的发现表明,前沿推理模型在以患者为中心的沟通上表现欠佳,在高级诊断能力上也存在困难,平均得分仅 31%。此外,我们观察到模型性能因患者角色而异,且随对话轮次增加而下降。本工作提供了综合的合成数据生成框架、数据集及评估框架,用于评估多轮心理健康对话中的 LLM。

关键词

引用

@article{arxiv.2505.20201,
  title  = {Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations},
  author = {Mohit Chandra and Siddharth Sriraman and Harneet Singh Khanuja and Yiqiao Jin and Munmun De Choudhury},
  journal= {arXiv preprint arXiv:2505.20201},
  year   = {2025}
}

备注

34 pages, 5 figures, 30 tables