黑盒大语言模型上的知识编辑
计算与语言
2024-02-20 v2 人工智能
机器学习
摘要
知识编辑 (KE) 旨在高效、精确地修改大语言模型 的行为,以更新特定知识而不对其他知识产生负面影响。当前研究主要集中在白盒 LLM 编辑上,忽略了一个重要场景:黑盒 LLM 编辑,即通过接口访问 LLM 且仅可获得文本输出。在本文中,我们首先正式引入黑盒 LLM 上的 KE,然后提出一个综合评估框架,以克服现有评估不适用于黑盒 LLM 编辑且缺乏全面性的局限。为解决当前方法中编辑数据的隐私泄露和风格过度编辑问题,我们引入了一个新颖的 postEdit 框架,通过下游后处理解决隐私问题,并通过对原始响应的细粒度编辑保持文本风格一致性。在两个基准上的实验和分析表明,postEdit 优于所有基线并实现了强泛化,特别是在风格保持方面有巨大提升(平均 )。
引用
@article{arxiv.2402.08631,
title = {Knowledge Editing on Black-box Large Language Models},
author = {Xiaoshuai Song and Zhengyang Wang and Keqing He and Guanting Dong and Yutao Mou and Jinxu Zhao and Weiran Xu},
journal= {arXiv preprint arXiv:2402.08631},
year = {2024}
}
备注
Work in progress