中文

何时能在心理健康领域信任 LLM?面向可靠 LLM 评估的大规模基准

计算与语言 2025-10-23 v1 计算机与社会 人机交互

摘要

由于治疗性对话在情感和认知上的复杂性,评估用于心理健康支持的大型语言模型(LLM)具有挑战性。现有基准在规模和可靠性上存在局限,通常依赖于合成或社交媒体数据,并且缺乏评估何时可以信任自动评判器的框架。为了满足对大规模对话数据集和评判器可靠性评估的需求,我们引入了两个提供生成与评估框架的基准。MentalBench-100k 汇集了来自三个真实场景数据集的 10,000 轮单轮对话,每轮对话均配有九个 LLM 生成的回复,从而产生 100,000 个回复对。MentalAlign-70k 通过在七个属性上对 70,000 次评分比较四个高性能 LLM 评判器与人类专家,重新构建了评估框架,这些属性被归为认知支持得分(CSS)和情感共鸣得分(ARS)。随后,我们采用情感认知一致性框架,这是一种使用组内相关系数(ICC)及置信区间来量化 LLM 评判器与人类专家之间一致性、连贯性和偏差的统计方法。我们的分析揭示了 LLM 评判器存在系统性评分膨胀,在指导性和信息量等认知属性上具有较强的可靠性,在共情方面精度降低,在安全性和相关性方面存在一定不可靠性。我们的贡献为心理健康领域 LLM 的可靠、大规模评估确立了新的方法论和实证基础。我们在以下地址发布基准和代码:https://github.com/abeerbadawi/MentalBench/

关键词

引用

@article{arxiv.2510.19032,
  title  = {When Can We Trust LLMs in Mental Health? Large-Scale Benchmarks for Reliable LLM Evaluation},
  author = {Abeer Badawi and Elahe Rahimi and Md Tahmid Rahman Laskar and Sheri Grach and Lindsay Bertrand and Lames Danok and Jimmy Huang and Frank Rudzicz and Elham Dolatabadi},
  journal= {arXiv preprint arXiv:2510.19032},
  year   = {2025}
}