中文

高效可验证的数据归因证明

机器学习 2025-08-19 v2

摘要

数据归因方法旨在回答类似“若模型是在不同数据集上训练的,它的预测会是什么?”的有用反事实问题。然而,采用经验影响或“datamodeling”等技术对数据归因模型进行估计仍然计算成本极高。这导致一个关键信任问题:若只有少数计算资源丰富的方可获取数据归因,那么资源受限的方如何信任所提供的归因确实“好”,尤其是当这些归因用于重要的下游应用(如数据定价)时。为此,本文提出了一种数据归因的交互式验证范式。一个不可信且计算能力强的 Prover 学习数据归因,然后与资源受限的 Verifier 进行交互式证明。我们的主要结果是提供了一个在概率近似正确 (Probably-Approximately-Correct, PAC) 语义下提供正式完备性、 soundness 与效率保证的协议。具体而言,如果 Prover 与 Verifier 均遵循该协议,Verifier 以概率 1-δ 接受与最优数据归因 (以均方误差为准则) ε 接近的数据归因。相反,如果 Prover 任意偏离该协议,即便拥有无限计算资源,也能被检测到(或仍为 Verifier 提供数据归因),除非以概率 δ 失败。重要的是,我们的协议确保 Verifier 的工作量(即必须执行的独立模型再训练次数)仅为 O(1/ε),即独立于数据集规模。 在技术层面,我们的结果适用于验证 Prover 在布尔超立方体上计算的任意线性函数,这使其在各种归因任务中具有广泛适用性。

关键词

引用

@article{arxiv.2508.10866,
  title  = {Efficiently Verifiable Proofs of Data Attribution},
  author = {Ari Karchmer and Martin Pawelczyk and Seth Neel},
  journal= {arXiv preprint arXiv:2508.10866},
  year   = {2025}
}