高效集成提升训练数据归因
机器学习
2024-05-28 v1 人工智能
摘要
训练数据归因(TDA)方法旨在量化单个训练数据点对模型预测的影响,广泛应用于数据中心AI中,如误标签检测、数据选择和版权补偿等。然而,现有方法在计算效率和归因效能之间存在权衡。再训练方法能够准确归因复杂非凸模型,但计算代价高昂;梯度方法高效但常常无法处理非凸模型。最近的研究表明,通过将多个独立训练模型的集合增强梯度方法,可显著提高归因效能。然而,这种方法对于非常大规模的应用仍不实用。在本工作中,我们发现对于梯度方法的集合,完全独立的训练是不必要的,我们提出了两种高效集成策略,DROPOUT ENSEMBLE和LORA ENSEMBLE,作为简单独立集成的替代方案。这些策略显著减少了训练时间(最高可减少80%)、服务时间(最高可减少60%)和空间成本(最高可减少80%),同时保持与简单独立集成相似的归因效能。我们的广泛实验结果表明,所提出的策略在多样化数据集和模型上有效,包括生成式设置,显著推进了TDA方法在更好计算效率和归因效能之间的帕累托前沿。
引用
@article{arxiv.2405.17293,
title = {Efficient Ensembles Improve Training Data Attribution},
author = {Junwei Deng and Ting-Wei Li and Shichang Zhang and Jiaqi Ma},
journal= {arXiv preprint arXiv:2405.17293},
year = {2024}
}