中文

去粗取精:通过参数高效模块操作实现模型缺陷遗忘

计算与语言 2024-01-19 v2

摘要

大语言模型(LLMs)已广泛应用于各类应用,但已知存在不真实性与毒性等问题。尽管参数高效模块(PEMs)在赋予模型新能力方面已展现成效,利用 PEMs 进行缺陷遗忘仍鲜有探索。本文提出一种 PEMs 操作方法,即先提取后减去(Ext-Sub),通过整合“专家”PEM 与“反专家”PEM 来增强 LLMs 的真实性与去毒能力。值得注意的是,反专家 PEM 因其擅长生成虚构内容而具备有价值的能力,这需要语言建模与逻辑叙述能力。我们的方法并非简单否定参数,而是提取并消除反专家 PEM 中仅有的缺陷能力,同时保留通用能力。为评估该方法在真实性与去毒方面的效果,我们在 LLMs 上开展了广泛实验,涵盖语言建模与数学推理等附加能力。实证结果表明,我们的方法有效提升了真实性与去毒水平,同时大体保留了 LLMs 的基础能力。

关键词

引用

@article{arxiv.2308.08090,
  title  = {Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation},
  author = {Xinshuo Hu and Dongfang Li and Baotian Hu and Zihao Zheng and Zhenyu Liu and Min Zhang},
  journal= {arXiv preprint arXiv:2308.08090},
  year   = {2024}
}

备注

AAAI 2024; The first two authors contributed equally to this paper