基准测试大型语言模型的动机性访谈能力
摘要
动机性访谈(Motivational Interviewing, MI)用于物质使用障碍患者的行为改变,其忠诚度通过动机性访谈治疗完整性(Motivational Interviewing Treatment Integrity, MITI)框架进行衡量。虽然大型语言模型(LLMs)可能生成与MI一致的治疗师反馈,但其使用MITI评估的能力尚未充分研究,尤其是在真实临床记录中。本文旨在对比专有模型和开源模型在真实临床记录中的MI能力,并评估其与人类治疗师的可区分性。方法方面,我们从LMArena中筛选了3个专有模型和7个开源模型,基于MITI 4.2框架在两个数据集上进行评估(96个手工制作的模型记录、34个真实临床记录)。我们在保持客户反馈不变的前提下,逐步生成对应的LLM和治疗师发言,并通过MITI各组件和语篇长度构建综合排名系统进行排序。我们还邀请两位独立的精神科医生进行可区分性实验,以识别人类与LLM的反馈。结果显示,所有10个测试的LLM在MITI措施上都表现出公平(MITI全局得分>3.5)到良好(MITI全局得分>4)的水平,其中三款最佳模型(gemma-3-27b-it、gemini-2.5-pro、grok-3)在真实临床记录上进行了测试。所有模型都表现出良好能力,LLM在复杂反思百分比(39% vs 96%)和反思-提问比例(1.2 vs >2.8)上均超越了人类专家。在可区分性实验中,精神科医生仅以56%的准确率识别LLM反馈,d-prime分别为gemini-2.5-pro和gemma-3-27b-it为0.17和0.25。结论表明,LLM在真实临床记录中能够实现良好的MI专业技能,这些发现表明即使是开源LLM也足以作为扩展MI咨询session的可行方案,尤其适用于资源匮乏的地区。
引用
@article{arxiv.2603.03846,
title = {Benchmarking Motivational Interviewing Competence of Large Language Models},
author = {Aishwariya Jha and Prakrithi Shivaprakash and Lekhansh Shukla and Animesh Mukherjee and Prabhat Chand and Pratima Murthy},
journal= {arXiv preprint arXiv:2603.03846},
year = {2026}
}
备注
17 pages, 6 figures, 2 tables