中文

模仿专有大型语言模型的虚假承诺

计算与语言 2023-05-26 v1

摘要

一种新兴的、用于低成本提升较弱语言模型的方法是:在更强模型(如 ChatGPT 这类专有系统)的输出上对其进行微调(例如 Alpaca、Self-Instruct 等)。该方法试图以较弱的开源模型廉价地模仿专有模型的能力。在本文中,我们批判性地分析了这一方法。我们首先微调了一系列模仿 ChatGPT 的语言模型,其基础模型规模(1.5B–13B)、数据来源以及模仿数据量(0.3M–150M tokens)各不相同。随后,我们使用众包评分者与标准 NLP 基准对这些模型进行了评估。起初,我们对其模仿模型的输出质量感到惊讶——它们似乎更擅长遵循指令,且众包工作者评价其输出可与 ChatGPT 相媲美。然而,当进行更有针对性的自动评估时,我们发现对于模仿数据中未充分覆盖的任务,模仿模型几乎未能缩小基础语言模型与 ChatGPT 之间的能力差距。我们表明,这些性能差异可能逃过人类评分者的注意,因为模仿模型善于模仿 ChatGPT 的风格而非其事实准确性。总体而言,我们得出结论:模型模仿是一个虚假承诺:开放与封闭语言模型之间存在显著的能力差距,以现有方法,唯有通过使用海量模仿数据或更强大的基础语言模型才能弥合。进而,我们认为提升开源模型最高杠杆的行动是解决开发更优基础语言模型这一难题,而非走模仿专有系统的捷径。

关键词

引用

@article{arxiv.2305.15717,
  title  = {The False Promise of Imitating Proprietary LLMs},
  author = {Arnav Gudibande and Eric Wallace and Charlie Snell and Xinyang Geng and Hao Liu and Pieter Abbeel and Sergey Levine and Dawn Song},
  journal= {arXiv preprint arXiv:2305.15717},
  year   = {2023}
}