中文

PEAKS:基于预测误差锚定的核相似性逐步选择关键训练样本

机器学习 2025-07-02 v4 机器学习

摘要

随着深度学习持续依赖越来越大的dataset,理解哪些样本对泛化最为重要已成为一个关键问题。尽管数据选择方面的进展持续不断,但新兴应用需要在动态环境中研究这一问题。为填补这一差距,我们提出了增量数据选择(IDS)问题,即样本以连续流式方式到达,需在没有完整数据源的情况下进行选择。在此设置下,学习者必须在同时学习底层任务的同时,逐步构建预定义大小的训练数据集。我们发现,在IDS中,新样本对模型状态的影响根本取决于其在特征空间中的几何关系以及其预测误差。基于这一洞察,我们提出了PEAKS(Prediction Error Anchored by Kernel Similarity),一种专为IDS量身定制的高效数据选择方法。我们的全面评估表明,PEAKS始终优于现有的选择策略。此外,随着训练数据规模在真实数据集上的增长,PEAKS相对于随机选择可获得越来越好的性能回报。代码可在https://github.com/BurakGurbuz97/PEAKS上获取。

关键词

引用

@article{arxiv.2504.05250,
  title  = {PEAKS: Selecting Key Training Examples Incrementally via Prediction Error Anchored by Kernel Similarity},
  author = {Mustafa Burak Gurbuz and Xingyu Zheng and Constantine Dovrolis},
  journal= {arXiv preprint arXiv:2504.05250},
  year   = {2025}
}