通过基于指令的链式思考提示学习编辑知识
计算与语言
2026-04-08 v1
摘要
大型语言模型(LLM)可以通过知识编辑有效处理过时信息。然而,当前方法面临两个关键局限性:(I)泛化性差:大多数方法僵化地注入新知识,而不能确保模型能够有效地用于解决实际问题。(II)范围有限:当前方法主要关注结构化事实三元组,忽略了现实情境中常见的多样化非结构化形式的事实信息(例如新闻、文章)。为解决这些挑战,我们提出了一种新范式:通过链式思考(CoTs)推理教导 LLM 编辑知识(CoT2Edit)。我们首先利用语言模型代理为结构化和非结构化编辑数据生成 CoTs,构建高质量指令数据。随后通过监督微调(SFT)和群体相对策略优化(GRPO)训练模型对编辑后的知识进行推理。在推理时,我们集成检索增强生成(RAG)以动态检索相关编辑事实,以实现实时知识编辑。实验结果表明,我们的方法仅通过对三款开源语言模型进行单轮训练,就在六种多样化的知识编辑场景中实现了强大的泛化能力。代码已公开于 https://github.com/FredJDean/CoT2Edit。
引用
@article{arxiv.2604.05540,
title = {Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting},
author = {Jinhu Fu and Yan Bai and Longzhu He and Yihang Lou and Yanxiao Zhao and Li Sun and Sen Su},
journal= {arXiv preprint arXiv:2604.05540},
year = {2026}
}
备注
Accepted by ACL 2026 main conference