中文

捕捉训练数据影响的时序依赖性

机器学习 2024-12-13 v1 机器学习

摘要

传统的数据影响估计方法,如影响函数,假设学习算法对训练数据是置换不变的。然而,现代训练范式,特别是针对基础模型使用随机算法和多阶段课程式训练,对数据排序敏感,从而违反了这一假设。这种匹配度不足导致影响函数不足以回答机器学习中的一个关键问题:如何捕捉数据影响随优化轨迹在训练期间变化的依赖性?为解决这一差距,我们形式化了轨迹特定留-one-out (LOO) 影响的概念,这量化了在训练的特定迭代中删除一个数据点对最终模型的影响,同时考虑了数据遇到的确切序列以及模型的优化轨迹。然而,对轨迹特定 LOO 的精确评估 presents a significant computational challenge。为此,我们提出数据价值嵌入 (data value embedding) 的一种新技术,使对轨迹特定 LOO 的高效近似成为可能。具体而言,我们计算一种训练数据嵌入,其封装了数据与不断变化的模型参数之间的累积相互作用。LOO 可通过数据价值嵌入与给定测试数据的梯度之间的简单点积来高效近似。由于数据价值嵌入捕捉了训练数据排序,因此为模型训练动力学提供了有价值的见解。特别是,我们发现数据影响存在不同的阶段,揭示了在训练的早期和晚期的数据点对最终模型的影响更大。这些见解转化为可操作的策略,通过战略性地安排数据选择过程的时间,来管理数据选择的计算开销,potentially opening new avenues in data curation research。

关键词

引用

@article{arxiv.2412.09538,
  title  = {Capturing the Temporal Dependence of Training Data Influence},
  author = {Jiachen T. Wang and Dawn Song and James Zou and Prateek Mittal and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2412.09538},
  year   = {2024}
}

备注

Correspondence to Jiachen T. Wang and Ruoxi Jia