中文

基于基础语言模型的动机式访谈风格反思的生成、蒸馏与评估

计算与语言 2024-02-05 v1

摘要

大型基础语言模型能够高水平地执行许多任务,但由于其规模庞大且为专有模型,在许多应用中难以部署。许多人将会有动力将基础模型的特定能力蒸馏到可以拥有和控制的小型模型中。在开发治疗性聊天机器人的过程中,我们希望蒸馏一种称为反思性倾听的能力,即治疗师对来访者的言语产生反思。这些反思要么重述来访者所说的话,要么将所说的话与相关的观察、想法或猜测联系起来,以鼓励和引导来访者继续思考。在本文中,我们提出了一种将反思生成能力从基础语言模型(GPT-4)蒸馏到小型模型的方法。我们首先展示,GPT-4 在使用零样本提示时,能够以接近 100% 的成功率生成反思,优于所有先前的方法。利用 GPT-4 生成的反思,我们对不同规模的 GPT-2 系列模型进行微调。GPT-2-small 模型在留出测试集上达到了 83% 的成功率,而 GPT-2 XL 达到了 90% 的成功率。我们还展示了 GPT-4 可以帮助完成评估蒸馏模型质量这一劳动密集型任务,将其用作零样本分类器。以三人人工评审为指导,该分类器达到了 0.66 的 Cohen-Kappa 系数,这是一个相当可观的评分者间信度数值。

关键词

引用

@article{arxiv.2402.01051,
  title  = {Generation, Distillation and Evaluation of Motivational Interviewing-Style Reflections with a Foundational Language Model},
  author = {Andrew Brown and Jiading Zhu and Mohamed Abdelwahab and Alec Dong and Cindy Wang and Jonathan Rose},
  journal= {arXiv preprint arXiv:2402.01051},
  year   = {2024}
}

备注

Accepted to EACL 2024 Long Paper