TherapyGym:临床忠诚度与安全性在治疗型聊天机器人中的评估与对齐
计算与语言
2026-03-20 v1 人工智能
计算机与社会
摘要
大型语言模型(LLM)日益用于精神健康支持领域,但现有的评估方法——流畅度指标、偏好测试和通用对话基准——未能捕捉心理治疗中至关重要的维度。我们引入 THERAPYGYM,一个评估并提升治疗型聊天机器人沿两个临床支柱:忠诚度与安全性的框架。忠诚度通过认知疗法评分量表(CTRS)进行衡量,该量表作为自动化管道,对多轮会话中对认知疗法技术的遵循情况进行评分。安全性通过多标签标注方案进行评估,涵盖治疗特定风险(例如未能 addressing 伤害或虐待)。为缓解基于 LLM 的评判器中的偏见和不可靠性,我们进一步发布 THERAPYJUDGEBENCH,一个包含 116 段对话及 1,270 项专家评分的验证集,用于审计和校准针对执业临床医生的标准。THERAPYGYM 也作为训练工具:CTRS 和基于安全性的奖励驱动强化学习,使用可配置的患者模拟器跨越多样化症状轮廓。在 THERAPYGYM 中训练的模型在专家评级方面取得改进,平均 CTRS 从 0.10 提升至 0.60(在 LLM 评判器下为 0.16 提升至 0.59)。我们的工作实现了按比例开发忠于证据基础实践且在高风险场景中更安全的治疗型聊天机器人的能力。
引用
@article{arxiv.2603.18008,
title = {TherapyGym: Evaluating and Aligning Clinical Fidelity and Safety in Therapy Chatbots},
author = {Fangrui Huang and Souhad Chbeir and Arpandeep Khatua and Sheng Wang and Sijun Tan and Kenan Ye and Lily Bailey and Merryn Daniel and Ryan Louie and Sanmi Koyejo and Ehsan Adeli},
journal= {arXiv preprint arXiv:2603.18008},
year = {2026}
}