稳健数据归因的自然几何:从凸模型到深层网络
机器学习
2025-12-11 v1 最优化与控制
摘要
数据归因方法用于识别模型预测由哪些训练样本产生,但其对分布性扰动的敏感性削弱了实际可靠性。我们提出了一套统一框架,用于实现 certified robust attribution,将其从凸模型推广到深层网络。对于凸模型情形,我们推导了具有可证明覆盖保障的Wasserstein-Robust Influence Functions(W-RIF)。对于深层网络,我们指出欧几里得认证因谱聚放大而变得空洞——即深层表征固有的病条件会使Lipschitz常数膨胀超过。这解释了为什么标准TRAK得分虽然是准确的点估计,却在几何上脆弱:简单的欧几里得鲁棒性分析导致0\%认证。我们的关键贡献是自然Wasserstein度量,它测量模型自身特征协方差所诱导的几何中的扰动。这一消除谱聚放大,使最坏情况下的灵敏度降低,并稳定归因估计。在CIFAR-10数据集上使用ResNet-18时,Natural W-TRAK认证了68.7\%的排序对,远超欧几里得基线的0\%——据我们了解,这是首个为神经网络归因提供非空洞认证界限。此外,我们证明了我们分析中产生的Self-Influence项等价于支配归因稳定性的Lipschitz常数,为基于杠杆的异常检测提供了理论依据。实验上,Self-Influence实现了0.970的AUROC,用于标签噪声检测,识别了94.1\%的损坏标签,只需检查前20\%的训练数据。
关键词
引用
@article{arxiv.2512.09103,
title = {Natural Geometry of Robust Data Attribution: From Convex Models to Deep Networks},
author = {Shihao Li and Jiachen Li and Dongmei Chen},
journal= {arXiv preprint arXiv:2512.09103},
year = {2025}
}