中文

TN-Eval:衡量行为治疗笔记质量的评分标准与评估协议

计算与语言 2025-03-27 v1 人工智能

摘要

行为治疗笔记对法律合规性和患者护理都至关重要。与身体健康的进度记录不同,行为治疗笔记的质量标准尚未得到充分发展。为弥合这一差距,我们与持证治疗师合作设计了全面的评分标准,用于评估治疗笔记在完整性、简洁性和忠实性方面的表现。进一步,我们扩展了包含行为健康对话及治疗师撰写笔记和 LLM 生成笔记的公开数据集,并应用评估框架衡量其质量。我们发现:(1)基于评分标准的人工评估协议比传统的 Likert 量表标注更可靠且更易解释。(2)LLM 在评估完整性和简洁性方面可模仿人类评估者,但在忠实性方面仍感到困难。(3)治疗师撰写的笔记往往缺乏完整性和简洁性,而 LLM 生成的笔记则包含幻觉。意外的是,在盲测测试中,治疗师更倾向于并认为 LLM 生成的笔记优于治疗师撰写的笔记。

关键词

引用

@article{arxiv.2503.20648,
  title  = {TN-Eval: Rubric and Evaluation Protocols for Measuring the Quality of Behavioral Therapy Notes},
  author = {Raj Sanjay Shah and Lei Xu and Qianchu Liu and Jon Burnsky and Drew Bertagnolli and Chaitanya Shivade},
  journal= {arXiv preprint arXiv:2503.20648},
  year   = {2025}
}