中文

基于后验抽样的稳定性核心集

机器学习 2025-11-24 v1

摘要

随着深度学习模型的规模不断扩大,计算需求的增加放大了有效核心集选择技术的需求。核心集选择旨在通过识别小型代表性子集来加快训练速度,这些子集可近似完整数据集的性能。尽管存在多种方法,但梯度基方法因其强大的理论基础和实际优势(特别是在数据预算有限的情况下)而居于优势。然而,这些方法面临挑战,例如简单随机梯度下降(SGD)作为意想不到的强基准,以及由于损失曲率随时间不匹配导致的代表性崩溃。在本工作中,我们提出了一种新框架,以解决这些限制。首先,我们在后验抽样与损失景观之间建立了联系,实现即使在高数据损坏情景下也能进行稳健的核心集选择。其次,我们基于后验抽样引入平滑损失函数,将其映射到模型权重上,以增强稳定性和泛化性,同时保持计算效率。我们还提出了一种新的收敛性分析,用于基于抽样的核心集选择方法。最后,通过大量实验,我们展示了该方法在各种数据集上实现更快的训练和更好的泛化,超越当前最先进的方法。

关键词

引用

@article{arxiv.2511.17399,
  title  = {Stable Coresets via Posterior Sampling: Aligning Induced and Full Loss Landscapes},
  author = {Wei-Kai Chang and Rajiv Khanna},
  journal= {arXiv preprint arXiv:2511.17399},
  year   = {2025}
}

备注

neurips 2025