中文

基于汉明查询序列重构的最优多类过拟合

机器学习 2019-10-22 v2 信息论 math.IT 机器学习

摘要

机器学习中测试数据集被过度复用的主要担忧是会导致过拟合。最近研究表明多类分类比二分类更抗过拟合。在 COLT 2019 的一个开放问题中,Feldman、Frostig 与 Hardt 要求刻画过拟合偏置量对类别数 mm、准确率查询数 kk 与数据集样本数 nn 的依赖关系。我们解决了该问题并确定了多类分类中可能的过拟合量。我们提供了计算高效的算法,实现了 Θ~(max{k/(mn),k/n})\tilde{\Theta}(\max\{\sqrt{{k}/{(mn)}}, k/n\}) 的过拟合偏置,与已知上界匹配。

关键词

引用

@article{arxiv.1908.03156,
  title  = {Optimal multiclass overfitting by sequence reconstruction from Hamming queries},
  author = {Jayadev Acharya and Ananda Theertha Suresh},
  journal= {arXiv preprint arXiv:1908.03156},
  year   = {2019}
}

备注

extended the results to unknown test set case