中文

G-SPEED:通用稀疏高效编辑模型

计算与语言 2023-10-17 v1

摘要

大语言模型(LLMs)在理解、生成和处理语言方面展现出了令人惊叹的能力。通过人机交互,LLMs能够自动理解人类发出的指令并输出预期内容,从而显著提升工作效率。在各类现实需求中,面向编辑的任务占据了相当大的比例,这类任务涉及一个交互过程,需要不断精炼已有文本以满足特定标准。由于多轮人机交互的需求以及复杂编辑任务的生成,对高效通用编辑模型的需求日益凸显。本文提出通用稀疏高效编辑模型(G-SPEED),该模型可通过单一模型满足多样化编辑需求,同时保持较低的计算成本。具体而言,我们首先提出一种新颖的无监督文本编辑数据聚类算法,以应对数据稀缺问题。随后,我们引入一种稀疏编辑模型架构,以缓解小语言模型固有的有限学习能力。实验结果表明,拥有508M参数的G-SPEED能够超越配备175B参数的LLMs。我们的代码和模型检查点可在 https://github.com/Banner-Z/G-SPEED 获取。

关键词

引用

@article{arxiv.2310.10480,
  title  = {G-SPEED: General SParse Efficient Editing MoDel},
  author = {Haoke Zhang and Yue Wang and Juntao Li and Xiabing Zhou and Min Zhang},
  journal= {arXiv preprint arXiv:2310.10480},
  year   = {2023}
}

备注

Accepted to the Findings of EMNLP 2023