中文

RippleBench:利用现有知识库捕捉涟漪效应

人工智能 2025-12-05 v1

摘要

针对语言模型的有针对性干预(如忘记、去偏、模型编辑)是精炼模型行为、维持知识更新的核心方法。虽然这些干预旨在修改模型内的特定信息(例如删除 virology 内容),但其影响常常蔓延到相关且未被意图覆盖的领域(例如过敏症);这些副作用通常称为涟漪效应。本文提出 RippleBench-Maker,一个用于生成 Q&A 数据集的自动工具,以衡量任何模型编辑任务中的涟漪效应。RippleBench-Maker 基于基于 Wikipedia 的 RAG 流程 (WikiRAG) 在目标概念(例如被遗忘的知识)的不同语义距离处生成多选问答。使用该框架,我们构建了 RippleBench-Bio,一个源自 WMDP(大量破坏性文献)数据集的基准,后者是常见的忘记基准。我们评估了八种最先进的忘记方法,发现所有方法在语义距离日益增加的主题上都表现出非平凡的准确度下降,每种方法都有各自的传播轮廓。为支持持续研究,我们发布了用于实时涟漪评估的代码库,以及该基准 RippleBench-Bio。

关键词

引用

@article{arxiv.2512.04144,
  title  = {RippleBench: Capturing Ripple Effects Using Existing Knowledge Repositories},
  author = {Roy Rinberg and Usha Bhalla and Igor Shilov and Flavio P. Calmon and Rohit Gandikota},
  journal= {arXiv preprint arXiv:2512.04144},
  year   = {2025}
}