流行实体删除知识时的灾难性副作用
计算与语言
2024-06-11 v1
摘要
语言模型(LMs)通过训练将世界知识编码到内部参数中。然而,语言模型可能从训练数据中学习到个人和保密信息,导致数据泄露等隐私问题。因此,针对从语言模型中删除知识的研究至关重要。本研究聚焦于语言模型中存储的知识,分析了知识删除副作用与相关知识实体之间的关系。我们的发现表明,删除与流行实体相关的知识可能导致灾难性的副作用。此外,本研究是首次在训练于人造知识图谱的模型上分析知识删除,指明了受控实验的新方向。
引用
@article{arxiv.2406.06032,
title = {The Curse of Popularity: Popular Entities have Catastrophic Side Effects when Deleting Knowledge from Language Models},
author = {Ryosuke Takahashi and Go Kamoda and Benjamin Heinzerling and Keisuke Sakaguchi and Kentaro Inui},
journal= {arXiv preprint arXiv:2406.06032},
year = {2024}
}