中文

DualXDA:稀疏、高效且可解释的数据归因

机器学习 2025-12-22 v3 人工智能

摘要

数据归因(Data Attribution, DA)是可解释人工智能(XAI)领域的一种新兴方法,旨在识别决定模型输出的有影响力的训练数据点。它力求提供关于模型及个体预测的透明度,例如用于模型调试、识别导致次优性能的数据相关原因。然而,现有的 DA 方法在应用于甚至中等规模的数据集和模型时,面临着过高的计算成本和内存需求,迫使从业者诉诸于可能无法捕捉底层模型真实推理过程的近似方法。此外,当前的归因方法表现出较低的稀疏性,导致大量训练样本具有不可忽略的归因分数,阻碍了数据中决定性模式的发现。在本工作中,我们介绍了 DualXDA,一个用于稀疏、高效且可解释 DA 的框架,由两个相互关联的方法组成:双重数据归因(DualDA)和可解释数据归因(XDA)。利用支持向量机(Support Vector Machine)理论,DualDA 提出了一种新颖的高效且有效的 DA 方法,为 AI 预测提供快速且自然稀疏的数据归因。在广泛的定量分析中,我们证明 DualDA 实现了高质量的归因,擅长解决一系列评估的下游任务,同时与原始的 Influence Functions 方法相比,将解释时间提高了高达 4,100,000 倍,与文献中迄今该方法最高效的近似相比提高了高达 11,000 倍。我们进一步介绍了 XDA,这是一种通过结合特征归因方法的能力来增强数据归因的方法,用以解释为何训练样本在影响性特征方面与测试样本的预测相关,我们对此进行了详细的定性展示和验证。

关键词

引用

@article{arxiv.2402.12118,
  title  = {Sparse, Efficient and Explainable Data Attribution with DualXDA},
  author = {Galip Ümit Yolcu and Moritz Weckbecker and Thomas Wiegand and Wojciech Samek and Sebastian Lapuschkin},
  journal= {arXiv preprint arXiv:2402.12118},
  year   = {2025}
}

备注

Accepted to Transactions on Machine Learning Research (TMLR), 2025