中文

具有可控泛化误差的回归训练数据子集选择

机器学习 2021-06-24 v1 机器学习

摘要

从大量训练样本中选取数据子集一直是实现高效且高性价比机器学习的一种成功方法。然而,在较小子集上训练的模型可能表现出较差的泛化能力。本文中,我们的目标是设计一种从训练数据中选取子集的算法,使模型能够快速训练,且不显著牺牲精度。更具体地,我们关注L2正则化回归问题的数据子集选择,并给出一种新的问题表述,该表述在验证集误差界约束下,针对可训练参数与训练数据子集同时最小化训练损失。我们通过若干技术创新来解决该问题。首先,利用原训练问题的对偶,以简化约束表示该问题,并证明对于多种建模选择,这一新表示的目标函数是单调且alpha-次模的函数。此类性质使我们开发出SELCON——一种高效的数据子集选择majorization-minimization算法,即便训练给出的模型估计不完美,该算法仍具有近似保证。最后,我们在多个数据集上的实验表明,SELCON比当前最先进方法更有效地权衡了精度与效率。

关键词

引用

@article{arxiv.2106.12491,
  title  = {Training Data Subset Selection for Regression with Controlled Generalization Error},
  author = {Durga Sivasubramanian and Rishabh Iyer and Ganesh Ramakrishnan and Abir De},
  journal= {arXiv preprint arXiv:2106.12491},
  year   = {2021}
}