中文

Daunce:基于不确定性估计的数据归因

机器学习 2025-05-30 v1

摘要

训练数据归因(TDA)方法旨在识别哪些训练样本最影响模型对特定测试数据的预测。通过量化这些影响,TDA 支持数据调试、筛选与估值等关键应用。基于梯度的 TDA 方法依赖梯度与二阶信息,限制了其大规模适用性。虽然近期基于随机投影的方法提升了可扩展性,但它们通常以牺牲归因精度为代价。受不确定性与影响函数之间联系的启发,我们引入了 Daunce——一种通过不确定性估计实现的简单而有效的数据归因方法。该方法通过微调一组扰动模型并计算这些模型间逐样本损失的协方差作为归因分数。Daunce 可扩展至大语言模型(LLMs),并相比现有 TDA 方法实现了更准确的归因。我们在从视觉任务到 LLM 微调的多种任务上验证了 Daunce,并进一步证明了其与黑盒模型访问的兼容性。应用于 OpenAI 的 GPT 模型,据我们所知,我们的方法实现了在专有 LLM 上进行数据归因的首例。

关键词

引用

@article{arxiv.2505.23223,
  title  = {Daunce: Data Attribution through Uncertainty Estimation},
  author = {Xingyuan Pan and Chenlu Ye and Joseph Melkonian and Jiaqi W. Ma and Tong Zhang},
  journal= {arXiv preprint arXiv:2505.23223},
  year   = {2025}
}