无需主题标签即可编辑大语言模型中的任意命题
计算与语言
2024-01-17 v1 人工智能
机器学习
摘要
大语言模型(LLM)编辑旨在修改 LLM 中的事实信息。定位并编辑(L&E)方法通过寻找相关信息在神经网络中的存储位置,并编辑该位置的权重来实现这一目标。编辑的目标是修改 LLM 对一个命题的响应,使其独立于措辞,同时不修改其对其他相关命题的响应。现有方法仅限于二元命题,这些命题表示主体和客体之间直接的二元关系。此外,现有方法依赖于语义主题标签,而这些标签在实践中可能不可用甚至无法明确定义。在本文中,我们证明,通过一种称为梯度追踪(GT)的简单快速定位方法,可以有效规避这两个问题。这种定位方法允许编辑任意命题,而不仅仅是二元命题,并且无需主题标签即可完成。由于命题总是具有真值,我们的实验将 LLM 视为一个布尔分类器,并编辑其对命题的真/假响应。我们的方法应用 GT 进行位置追踪,然后使用秩一模型编辑(ROME)的一个温和变体在该位置编辑模型。在源自 CounterFact 数据集的二元命题数据集上,我们表明,我们的方法——在没有主题标签的情况下——性能接近那些能够获取主题标签的最先进的 L&E 方法。随后,我们引入了一个新的数据集——事实准确性分类测试(FACT),该数据集包含非二元命题,且主题标签通常不适用,因此超出了现有 L&E 方法的范围。尽管如此,我们证明使用我们的方法可以在 FACT 上进行编辑。
引用
@article{arxiv.2401.07526,
title = {Editing Arbitrary Propositions in LLMs without Subject Labels},
author = {Itai Feigenbaum and Devansh Arpit and Huan Wang and Shelby Heinecke and Juan Carlos Niebles and Weiran Yao and Caiming Xiong and Silvio Savarese},
journal= {arXiv preprint arXiv:2401.07526},
year = {2024}
}