中文

微调开源权重语言模型以实现认知行为疗法:一项可行性研究

人工智能 2025-09-23 v2 人机交互

摘要

认知行为疗法 (CBT) 是一种已获证实、基于证据的抑郁症主要诊断治疗方法。不幸的是,存在显著的障碍阻止个体获取 CBT,包括成本、治疗师稀缺和污名化。本研究探讨了微调小型开源权重大型语言模型 (LLM) 以实现 CBT 治疗抑郁症的可行性。使用由 Nous Research 微调的 Llama 3.1 405b 生成的合成 CBT transcript,我们微调了三个模型:Mistral 7b v0.3、Qwen 2.5 7b 和 Llama 3.1 8b。通过修改的认知疗法评估量表 (CTRS) 评估了 CBT 忠诚度。所有微调后的模型都与彼此比较,并与其 instruct 调整变体进行比较。生成模拟患者 transcript 用于评估模型性能,instruct 和 CBT 微调模型充当治疗师,DeepSeek-V2.5 充当患者。这些模拟 transcript 由 Gemini 1.5 Pro-002 在修改的 CTRS 上进行评估。我们的发现表明,CBT 微调模型在总体 CTRS 分数上显著优于其 instruct 调整后的对手,平均提高 11.33 分(p < 0.001)。Llama 3.1 8b 表现最佳(平均 CTRS 分数 67.86 +/- 7.24),其后是 Qwen 2.5 7b(64.28 +/- 9.55)和 Mistral 7b v0.3(64.17 +/- 9.79),这些模型之间的差异具有统计学显著性。CBT 微调模型在实施核心 CBT 技术和提供共情响应方面都表现出色,但也观察到在议程遵循性、探索深度和长程语境连贯性方面存在局限。本研究确立了 CBT 特定微调能够有效地在小型 LLM 中编码治疗能力,尽管在临床部署之前仍需解决显著的技术和伦理考量。

关键词

引用

@article{arxiv.2412.00251,
  title  = {Fine-Tuning Open-Weight Language Models to Deliver Cognitive Behavioral Therapy for Depression: A Feasibility Study},
  author = {Talha Tahir},
  journal= {arXiv preprint arXiv:2412.00251},
  year   = {2025}
}