中文

超越规模:小型语言模型在心理健康理解方面与 GPT-4 相当

计算与语言 2025-07-15 v2

摘要

小型语言模型 (SLM) 作为敏感应用的隐私保留替代方案的出现,引发了一个关于其固有理解能力是否相当于大型语言模型 (LLM) 的根本性问题。本文通过在多样化分类任务上的系统评估,探讨了当前 SLM 在心理健康理解能力。我们采用零样本和少样本学习范式,对其性能进行基准测试,以与既定 LLM 基线进行比较,以阐明它们在该关键领域中的相对优势与局限。我们评估了五个最先进的 SLM(Phi-3、Phi-3.5、Qwen2.5、Llama-3.2、Gemma2),对比三个 LLM(GPT-4、FLAN-T5-XXL、Alpaca-7B),在六个心理健康理解任务上进行测试。我们的发现表明,SLM 在二元分类任务上(零样本情境下的 F1 分数为 0.64 vs 0.66)的平均性能在 LLM 之间保持在 2% 以内,尽管参数数量相差数个数量级,仍显示出显著的能力。两个模型类别在多类别严重程度任务上均经历了类似的退化(下降超过 30%),这表明细致的临床理解挑战跨越了模型规模。少样本提示为 SLM 提供了显著的改进(最高达 14.6%),而 LLM 的提升更为不稳定。我们的工作凸显了 SLM 在心理健康理解方面的潜力,表明它们可以是分析敏感在线文本数据的有效隐私保留工具。特别是它们能够通过最少的数据快速适应和专门化的能力,使其成为可扩展心理健康筛查工具的有前景的候选人。

关键词

引用

@article{arxiv.2507.08031,
  title  = {Beyond Scale: Small Language Models are Comparable to GPT-4 in Mental Health Understanding},
  author = {Hong Jia and Shiya Fu and Feng Xia and Vassilis Kostakos and Ting Dang},
  journal= {arXiv preprint arXiv:2507.08031},
  year   = {2025}
}