执念治疗师:基于监督微调与机率比策略优化训练大型语言模型执行接受与承诺疗法
计算与语言
2025-09-23 v2 人工智能
摘要
接受与承诺疗法(Acceptance and Commitment Therapy, ACT)是一种第三波认知行为疗法,已在多种精神医学状况中展现出潜在疗效。本研究探讨了后训练方法及显式推理对小型开源大型语言模型(LLM)执行 ACT 能力的影响。我们使用 Mistral-Large 生成的合成 ACT transcripts 进行训练,将 Llama-3.2-3b-Instruct 通过两种不同方法进行监督微调(SFT)和机率比策略优化(ORPO),分别配合与否显式链式思维(chain-of-thought, COT)推理步骤。本研究将这四种后训练变体与基础 Instruct 模型进行比较评估。这些模型在模拟治疗情境中进行基准测试,通过专门微调的人类评估 LLM 评判器,对 ACT 忠诚度测量(ACT-FM)和治疗同理心量表(TES)进行定量评估。我们的发现表明,ORPO 训练的模型在 ACT 忠诚度(χ²(5) = 185.15, p < .001)和治疗同理心(χ²(5) = 140.37, p < .001)方面显著优于其 SFT 和 Instruct 同类模型。COT 的效果取决于具体训练方法:它为 SFT 模型提供显著帮助,使 ACT-FM 分数平均提高 2.68 分(p < .001),而对优势的 ORPO 或 Instruct 微调模型则无明显益处。我们认为 ORPO 的优势源于其学习治疗“过程”而非单纯模仿“内容”,而 ACT 的关键要素之一;而 COT 则是仅通过模仿训练的模型所必需的支架。本研究表明,偏好对齐的策略优化能够有效在小型 LLM 中植入 ACT 能力,而显式推理的实用性高度取决于底层训练范式。
引用
@article{arxiv.2509.09712,
title = {The Thinking Therapist: Training Large Language Models to Deliver Acceptance and Commitment Therapy using Supervised Fine-Tuning and Odds Ratio Policy Optimization},
author = {Talha Tahir},
journal= {arXiv preprint arXiv:2509.09712},
year = {2025}
}