中文

LingxiDiagBench:用于中文精神科诊疗的多智能体 LLM 基准框架

多智能体系统 2026-02-12 v2 计算与语言

摘要

精神障碍在全球范围内高度普及,但精神科医生短缺以及基于访谈的诊断内在主观性,构成了及时且一致的心理健康评估的重大障碍。AI辅助精神科诊断的进展受限于缺乏能够同时提供真实患者模拟、临床验证诊断标签并支持动态多轮咨询的基准数据集。我们提出了 LingxiDiagBench,一个大规模多智能体基准,用于评估 LLM 在中文精神科诊疗中的静态诊断推理与动态多轮咨询能力。其核心是 LingxiDiag-16K,一个包含 16,000 条与电子病历对齐的合成咨询对话数据集,旨在再现不同 12 类 ICD-10 精神科诊断类别下的真实临床人口统计和诊断分布。通过对 state-of-the-art LLM 的大规模实验,我们确立了关键发现:(1)尽管 LLM 在二元抑郁-焦虑分类中实现了高准确率(最高达 92.3%),但在抑郁-焦虑共病识别(43.0%)和 12 分类差别诊断(28.5%)方面的性能显著下降;(2)动态咨询往往低于静态评估,这表明无效的信息收集策略显著损害下游诊断推理;(3)由 LLM 作为评判家所评估的咨询质量仅与诊断准确率呈中等相关性,这表明结构化提问本身并不确保正确的诊断决策。我们发布 LingxiDiag-16K 和完整的评估框架,以支持可重复的研究,地址为 https://github.com/Lingxi-mental-health/LingxiDiagBench。

关键词

引用

@article{arxiv.2602.09379,
  title  = {LingxiDiagBench: A Multi-Agent Framework for Benchmarking LLMs in Chinese Psychiatric Consultation and Diagnosis},
  author = {Shihao Xu and Tiancheng Zhou and Jiatong Ma and Yanli Ding and Yiming Yan and Ming Xiao and Guoyi Li and Haiyang Geng and Yunyun Han and Jianhua Chen and Yafeng Deng},
  journal= {arXiv preprint arXiv:2602.09379},
  year   = {2026}
}