衡量真正重要的东西!!评估心理健康对话中的治疗原则
计算与语言
2026-04-15 v3
摘要
大语言模型在心理健康应用中的日益使用,呼吁建立基于原则的评估框架,以评估其与心理治疗最佳实践的对齐程度,而不仅仅是表面层面的流畅性。虽然近期系统在对话能力方面表现出色,但它们缺乏评估对核心治疗原则遵守程度的结构化机制。在本文中,我们研究了评估AI生成的治疗师式回答在临床基础上是否适当和有效的问题。我们根据六个治疗原则——非评判性接纳、温暖、尊重自主性、积极倾听、反思性理解和情境适当性——使用细粒度序数量表评估每位治疗师的陈述。我们引入了FAITH-M,一个由专家分配序数评分的基准,并提出了CARE,一个多阶段评估框架,整合了对话内上下文、对比示例检索和知识蒸馏的思维链推理。实验表明,CARE达到了63.34的F1分数,而强基线Qwen3的F1分数为38.56,提升了64.26%,Qwen3同时也是CARE的骨干网络,这表明增益来自结构化推理和上下文建模而非骨干网络容量本身。专家评估和外部数据集评估进一步证明了在领域迁移下的鲁棒性,同时突显了建模隐含临床细微差别的挑战。总体而言,CARE为评估AI心理健康系统中的治疗保真度提供了一个临床基础的框架。
引用
@article{arxiv.2604.05795,
title = {Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation},
author = {Abdullah Mazhar and Het Riteshkumar Shah and Aseem Srivastava and Smriti Joshi and Md Shad Akhtar},
journal= {arXiv preprint arXiv:2604.05795},
year = {2026}
}
备注
Accepted at ACL 2026 (Main)