用于数据调试的影响信号比较分析
机器学习
2025-06-16 v1 人工智能
摘要
提高训练样本的质量对于改善机器学习模型的可靠性和性能至关重要。在本文中,我们对用于调试训练数据的影响基信号进行了比较评估。这些信号可以潜在地从可能含有噪声的训练集中识别出错误标注和异常样本,从而在构建模型时减轻对专用故障检测器的需求。尽管文献中近期已提出若干影响基信号(例如 Self-Influence、Average Absolute Influence、Marginal Influence、GD-class),但尚无实验研究评估它们在使用统一影响估计器(例如 TraceIn)时,在不同数据模态(图像和表格)和深度学习模型(从头训练或基于基础模型训练)下检测不同故障类型(例如错误标注和异常样本)的能力。通过广泛实验,我们证明 Self-Influence 等信号能有效检测错误标注样本,但现有信号均无法检测异常样本。现有信号未考虑训练动态,即样本对模型的影响如何随训练过程而变化,而某些信号则陷入了影响抵消效应,即由于无符号分数的累加导致影响分数为零,从而产生误导性的影响归因。
引用
@article{arxiv.2506.11584,
title = {A Comparative Analysis of Influence Signals for Data Debugging},
author = {Nikolaos Myrtakis and Ioannis Tsamardinos and Vassilis Christophides},
journal= {arXiv preprint arXiv:2506.11584},
year = {2025}
}
备注
Accepted and presented at the Data-centric Machine Learning Research (DMLR) Workshop at ICML 2024