中文

CLaRE-ty Amid Chaos:量化LLM编辑中表征纠缠以预测涟漪效应

机器学习 2026-04-08 v2

摘要

大型语言模型(LLM)的静态知识表征随着时间的推移不可避免地会变得过时或不正确。虽然模型编辑技术提供了一种通过修改模型事实关联来解决此问题的有前景的方案,但它们常常会产生不可预测的涟漪效应,即即使是不必要的行为变化也会向隐藏空间传播。本文引入了CLaRE,一种轻量级的表征级技术,用于识别这些涟漪效应可能发生的地方。与先前的梯度方法不同,CLaRE使用来自单个中间层的前向激活来量化事实之间的纠缠,避免了昂贵的反向传播。为支持系统化研究,我们准备并分析了一个由11,427个事实组成的语料库,这些事实取自三个现有数据集。使用CLaRE,我们为多个模型计算了大规模的纠缠图,捕捉局部编辑如何通过表征空间传播。这些图使得模型编辑的保护集、审计轨迹、高效红队测试以及可扩展的事后编辑评估得以实现。与基线方法相比,CLaRE在与涟漪效应的斯佩尔曼相关性方面平均提高了62.2%,速度为2.74×2.74\times,峰值GPU内存使用为2.85×2.85\times。此外,CLaRE仅需基线方法存储量的很小一部分即可计算和保存事实表征。我们的数据集和语料库可在 https://github.com/manitbaser/CLaRE 获取。

关键词

引用

@article{arxiv.2603.19297,
  title  = {CLaRE-ty Amid Chaos: Quantifying Representational Entanglement to Predict Ripple Effects in LLM Editing},
  author = {Manit Baser and Alperen Yildiz and Dinil Mon Divakaran and Mohan Gurusamy},
  journal= {arXiv preprint arXiv:2603.19297},
  year   = {2026}
}

备注

Accepted to ACL 2026 Findings