中文

通过多属性人工评估评估 LLM 响应中的心理健康支持质量

人工智能 2026-01-27 v1 人机交互

摘要

不断加剧的全球心理健康危机以持续的治疗差距、可用性不足以及合格治疗师短缺为标志,这使得大语言模型(LLMs)成为可扩展支持的一个有前景的途径。虽然 LLM 为可获取的情感援助提供了潜力,但其可靠性、治疗相关性以及与人类标准的一致性仍具挑战。本文引入了一种以人为基础的评估方法,旨在评估 LLM 在治疗对话中生成的响应。我们的方法包括从包含真实世界场景问题的数据集中策划了一个包含 500 次心理健康对话的数据集,并评估了九个不同 LLM 生成的响应,包括闭源和开源模型。更具体地说,这些响应由两名受过精神病学训练的专家进行评估,他们根据全面的 6 属性评分规则,在 5 点李克特量表上独立对每个响应进行评分。该评分规则涵盖了认知支持和情感共鸣,为治疗质量提供了多维视角。我们的分析表明,LLM 通过产生安全、连贯且临床适当的信息提供了强大的认知可靠性,但它们表现出不稳定的情感一致性。尽管闭源模型(例如 GPT-4o)提供了平衡的治疗响应,但开源模型表现出更大的变异性和情感平淡。我们揭示了持续存在的认知-情感差距,并强调需要具有失败感知能力、基于临床的评估框架,在面向心理健康的 LLM 中将关系敏感性与信息准确性并重。我们提倡以治疗敏感性为中心、包含人在回路(human in the loop)的平衡评估协议,并提供一个框架来指导面向心理健康的对话式 AI 的负责任设计和临床监督。

关键词

引用

@article{arxiv.2601.18630,
  title  = {Assessing the Quality of Mental Health Support in LLM Responses through Multi-Attribute Human Evaluation},
  author = {Abeer Badawi and Md Tahmid Rahman Laskar and Elahe Rahimi and Sheri Grach and Lindsay Bertrand and Lames Danok and Frank Rudzicz and Jimmy Huang and Elham Dolatabadi},
  journal= {arXiv preprint arXiv:2601.18630},
  year   = {2026}
}