TN-Eval:衡量行为治疗笔记质量的评分标准与评估协议
计算与语言
2025-03-27 v1 人工智能
摘要
行为治疗笔记对法律合规性和患者护理都至关重要。与身体健康的进度记录不同,行为治疗笔记的质量标准尚未得到充分发展。为弥合这一差距,我们与持证治疗师合作设计了全面的评分标准,用于评估治疗笔记在完整性、简洁性和忠实性方面的表现。进一步,我们扩展了包含行为健康对话及治疗师撰写笔记和 LLM 生成笔记的公开数据集,并应用评估框架衡量其质量。我们发现:(1)基于评分标准的人工评估协议比传统的 Likert 量表标注更可靠且更易解释。(2)LLM 在评估完整性和简洁性方面可模仿人类评估者,但在忠实性方面仍感到困难。(3)治疗师撰写的笔记往往缺乏完整性和简洁性,而 LLM 生成的笔记则包含幻觉。意外的是,在盲测测试中,治疗师更倾向于并认为 LLM 生成的笔记优于治疗师撰写的笔记。
引用
@article{arxiv.2503.20648,
title = {TN-Eval: Rubric and Evaluation Protocols for Measuring the Quality of Behavioral Therapy Notes},
author = {Raj Sanjay Shah and Lei Xu and Qianchu Liu and Jon Burnsky and Drew Bertagnolli and Chaitanya Shivade},
journal= {arXiv preprint arXiv:2503.20648},
year = {2025}
}