关于基于情境探测的数据归因可行性研究
计算与语言
2025-02-12 v2
摘要
数据归因方法用于衡量训练数据对模型输出的贡献,在数据 curated 和模型可解释性等领域具有重要应用。然而,许多标准数据归因方法,如影响函数,都利用模型梯度且计算成本高昂。我们在论文中展示,情境探测(ICP)——即通过提示大语言模型(LLM)——可作为基于梯度的数据归因方法的快速代理,用于数据选择,在数据相似性条件下。我们在标准 NLP 任务上对此关系进行经验研究,表明 ICP 与基于梯度的数据归因在识别具有相似任务类型和内容的训练数据的影响因素方面具有很好的相关性。此外,对 ICP 和基于梯度的数据归因所选取的影响数据进行微调可实现相当的下游性能,进一步凸显了它们之间的相似性。我们还通过线性回归任务中的合成数据检验了 ICP 与基于梯度的数据归因之间的关系。我们的合成数据实验的结果与来自 NLP 任务的实验结果相似,这表明这种关系可以在更简单的设置中被隔离,这为弥合它们之间的差异提供了一条途径。
引用
@article{arxiv.2407.12259,
title = {On the Feasibility of In-Context Probing for Data Attribution},
author = {Cathy Jiao and Gary Gao and Aditi Raghunathan and Chenyan Xiong},
journal= {arXiv preprint arXiv:2407.12259},
year = {2025}
}
备注
NAACL 2025