基于汉明查询序列重构的最优多类过拟合
机器学习
2019-10-22 v2 信息论
math.IT
机器学习
摘要
机器学习中测试数据集被过度复用的主要担忧是会导致过拟合。最近研究表明多类分类比二分类更抗过拟合。在 COLT 2019 的一个开放问题中,Feldman、Frostig 与 Hardt 要求刻画过拟合偏置量对类别数 、准确率查询数 与数据集样本数 的依赖关系。我们解决了该问题并确定了多类分类中可能的过拟合量。我们提供了计算高效的算法,实现了 的过拟合偏置,与已知上界匹配。
引用
@article{arxiv.1908.03156,
title = {Optimal multiclass overfitting by sequence reconstruction from Hamming queries},
author = {Jayadev Acharya and Ananda Theertha Suresh},
journal= {arXiv preprint arXiv:1908.03156},
year = {2019}
}
备注
extended the results to unknown test set case