中文

重写历史:用于研究数据对模型行为影响的干预分析实验方案

计算与语言 2026-05-20 v2

摘要

我们提出了一种实验方案,用于研究训练数据与语言模型(LM)行为之间的关系。我们概述了对数据批次进行干预(即“重写历史”)的步骤,然后在该数据上重新训练模型检查点,以检验关于数据与行为之间关系的假设。我们的方案将此类干预分解为多个阶段,包括从衡量模型行为的基准中选取评估项目、将相关文档与这些项目进行匹配,以及在重新训练和测量效果之前修改这些文档。我们通过关于LM中事实性知识获取的案例研究来展示我们方案的实用性,使用共现统计和信息检索方法来识别可能有助于知识学习的文档。我们的结果补充了先前将共现与模型行为联系起来的观察性分析,同时表明现有的识别相关训练文档的方法并不能完全解释LM正确回答知识问题的能力。总的来说,我们概述了一个研究人员可以遵循的方案,以检验关于训练数据如何影响模型行为的进一步假设。我们的代码已公开,以促进未来的工作。

关键词

引用

@article{arxiv.2510.14261,
  title  = {Rewriting History: A Recipe for Interventional Analyses to Study Data Effects on Model Behavior},
  author = {Rahul Nadkarni and Yanai Elazar and Hila Gonen and Noah A. Smith},
  journal= {arXiv preprint arXiv:2510.14261},
  year   = {2026}
}

备注

Accepted to TACL, pre-MIT Press publication version