中文

驯服数据归因中的超参数敏感性:无需昂贵重训练的实用选择

机器学习 2025-10-24 v2 机器学习

摘要

数据归因方法量化了单个训练数据点对机器学习模型的影响,在现代 AI 的以数据为中心的应用中日益普及。尽管该领域近期涌现了大量新方法,但这些方法中超参数调整的影响仍待深入探索。在本工作中,我们提出了首个大规模实证研究,以理解常见数据归因方法的超参数敏感性。我们的结果表明,大多数方法确实对某些关键超参数敏感。然而,与典型的机器学习算法——其超参数可以使用计算成本较低的验证指标进行调整——不同,评估数据归因性能通常需要在训练数据子集上重训练模型,使得此类指标对于超参数调整而言成本过高。这对数据归因方法的实际应用构成了一个关键的开放性挑战。为了应对这一挑战,我们提倡更好地从理论上理解超参数行为,以指导高效的调整策略。作为案例研究,我们对影响函数方法许多变体中至关重要的正则化项进行了理论分析。基于此分析,我们提出了一种无需模型重训练即可选择正则化值的轻量级过程,并在一系列标准数据归因基准上验证了其有效性。总体而言,我们的研究识别了数据归因实际应用中一个基本但被忽视的挑战,并强调了未来方法开发中仔细讨论超参数选择的重要性。

关键词

引用

@article{arxiv.2505.24261,
  title  = {Taming Hyperparameter Sensitivity in Data Attribution: Practical Selection Without Costly Retraining},
  author = {Weiyi Wang and Junwei Deng and Yuzheng Hu and Shiyuan Zhang and Xirui Jiang and Runting Zhang and Han Zhao and Jiaqi W. Ma},
  journal= {arXiv preprint arXiv:2505.24261},
  year   = {2025}
}