DataDignity:大型语言模型的训练数据归因
人工智能
2026-05-08 v1
摘要
审计语言模型输出通常需要的不仅仅是判断正确性:审计员可能需要识别哪个源文档最有可能支持响应中表达的知识。我们将此研究为精确定位溯源:给定一个提示、一个目标模型响应和一个候选语料库,对最能支持该响应的文档进行排序。我们引入了FakeWiki,一个包含3,537篇虚构维基百科风格文章的受控基准,旨在保持真实溯源的同时削弱词汇捷径。FakeWiki包括QA探测、保留源的释义、逆向生成变体、在保持主题相似的同时移除答案关键事实的困难反文档,以及五种查询条件:干净提示加上四种越狱启发式变换。我们评估了七种检索基线、一种免训练的激活引导检索融合方法SteerFuse,以及一种有监督的对比溯源排序器ScoringModel。ScoringModel将响应和文档特征映射到一个共享空间,并使用InfoNCE进行训练,采用批内、检索挖掘和反文档负样本。在九个开源指令微调LLM和五种查询条件下,ScoringModel将平均Recall@10从最强检索基线的35.0提高到52.2,无需推理时融合,并在41/45个模型-条件组合中胜出。SteerFuse通常是第二好的,尽管不需要监督训练,这表明激活空间证据可以有效补充文本检索。在越狱启发式变换查询上,ScoringModel的Recall@10比最佳基线平均提高15.7个百分点。总体而言,我们的工作表明,稳健的训练数据归因需要能够将真实答案支持与主题或词汇相似性区分开的评估设置。
引用
@article{arxiv.2605.05687,
title = {DataDignity: Training Data Attribution for Large Language Models},
author = {Xiaomin Li and Andrzej Banburski-Fahey and Jaron Lanier},
journal= {arXiv preprint arXiv:2605.05687},
year = {2026}
}