大语言模型的知识编辑:综述
计算与语言
2024-09-23 v4 人工智能
摘要
大语言模型(LLMs)近期因其基于海量知识与推理能力来理解、分析和生成文本的卓越能力,改变了学术与产业界格局。然而,LLMs的一个主要缺陷在于其因空前规模的参数量而导致预训练计算成本巨大。当需要将新知识频繁引入预训练模型时,这一劣势更被加剧。因此,开发高效且有效的技术来更新预训练LLMs势在必行。传统方法通过直接微调将新知识编码进预训练LLMs。但朴素地重训练LLMs计算密集,且存在退化模型中与更新无关宝贵预训练知识的风险。近来,基于知识的模型编辑(KME)日益受到关注,其旨在精确修改LLMs以融入特定知识,而不对其它无关知识产生负面影响。本综述旨在对KME领域的近期进展提供全面而深入的概览。我们首先引入KME的一般形式化以涵盖不同KME策略。随后,基于新知识引入预训练LLMs的方式给出KME技术的创新分类法,并考察现有KME策略,分析每类方法的关键洞见、优势与局限。此外,相应介绍了KME的代表性指标、数据集与应用。最后,我们深入分析了KME的实用性及剩余挑战,并建议了进一步推动该领域发展的有前景研究方向。
引用
@article{arxiv.2310.16218,
title = {Knowledge Editing for Large Language Models: A Survey},
author = {Song Wang and Yaochen Zhu and Haochen Liu and Zaiyi Zheng and Chen Chen and Jundong Li},
journal= {arXiv preprint arXiv:2310.16218},
year = {2024}
}
备注
Accepted by ACM Computing Surveys