中文

通过最小预计算实现高效知识编辑

计算与语言 2025-06-05 v1 人工智能

摘要

知识编辑方法如 MEMIT 能够通过单句话更新事实及其后果来实现数据和计算效率的更新。然而,往往被忽视的是一个“预计算步骤”,该步骤需要一次性的显著计算成本。MEMIT 的作者原本需要为每个被编辑层预计算约 4400 万个隐藏向量,这需要对 4400 万个标记进行一次前向传递。对于 GPT-J (6B),该预计算步骤需在单块 GPU 上花费 36 小时,而对于 Llama2-7B 则需约 40 小时。此外,随模型规模增长,预计算时间也随之增大。本文表明,这种过度的计算成本并非必需。使用 MEMIT 及相关方法(如 ROME 和 EMMET)的知识编辑,可通过预计算极少数 4400 万个隐藏向量中的一小部分来实现。我们首先提出隐藏向量预计算的理论最低要求,以确保这些编辑方法的解决方案存在。随后我们经验性地表明,这些方法的知识编辑可通过预计算显著更少的隐藏向量来完成。具体而言,我们表明预计算步骤可在原定数量的 0.3% 以下完成。这大大节省了预计算时间,使用户可在数分钟内开始编辑新的模型。

关键词

引用

@article{arxiv.2506.04226,
  title  = {Efficient Knowledge Editing via Minimal Precomputation},
  author = {Akshat Gupta and Maochuan Lu and Thomas Hartvigsen and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2506.04226},
  year   = {2025}
}

备注

ACL 2025 Main Conference