中文

通过适应直接偏好优化实现语言模型的知识编辑

计算与语言 2024-09-25 v2 人工智能

摘要

大型语言模型(LLMs)随着时间推移可能会过时,因为它们可能缺乏更新的世界知识,导致事实知识错误和差距。知识编辑(KE)旨在使用不需昂贵重新训练的权重更新来克服这一挑战。我们提出将KE视为LLM对齐问题。为此目标,我们引入知识直接偏好优化(KDPO),这是一种更适用于知识修改的直接偏好优化(DPO)变体。我们的方法基于一种在线方法,不断更新模型中存储的知识。我们将当前知识作为负样本,将我们想要引入的新知识作为正样本进行DPO。我们还使用教师强制进行负样本生成,并使用正样本进行优化,这有助于保持局部化变更。我们在各种数据集和模型上测试了我们的KE方法,并与几种前沿方法进行了比较,进行了100和500次顺序编辑。此外,我们进行了与标准DPO方法的消融研究。我们的实验结果表明,我们的修改DPO方法实现了更精细的KE, achieving similar or better performance compared to previous methods。

关键词

引用

@article{arxiv.2406.09920,
  title  = {Knowledge Editing in Language Models via Adapted Direct Preference Optimization},
  author = {Amit Rozner and Barak Battash and Lior Wolf and Ofir Lindenbaum},
  journal= {arXiv preprint arXiv:2406.09920},
  year   = {2024}
}

备注

9 pages, 4 figures