主动容忍测试
机器学习
2017-11-02 v1 机器学习
摘要
在这项工作中,我们给出了在主动模型中对非平凡类进行容忍测试的首批算法:估计目标函数到假设类 C 关于任意分布 D 的距离,仅使用对从 D 抽取的多项式规模未标记样本池中少量标签查询。具体而言,我们证明对于直线上的 d 个区间并集类 D,我们仅通过对大小为 的未标记样本池进行 次标签查询,就能以加性误差 epsilon 估计该类中最优假设的误差率。此处的关键点是所需标签数量与该类的 VC 维无关。这扩展了 Balcan 等人 [2012] 的工作,他们解决了该类的非容忍测试问题(区分零误差情况与类中最优假设误差大于 epsilon 的情况)。我们还考虑了在此设定下估计给定学习算法 A 性能的相关问题。即,给定从分布 D 抽取的大型未标记样本池,我们能否仅通过少量标签查询来估计若整个数据集被标记时 A 的表现?我们聚焦于 k-最近邻 风格算法,并展示了我们的结果如何应用于超参数调优(为给定学习问题选择最佳的 k 值)问题。
引用
@article{arxiv.1711.00388,
title = {Active Tolerant Testing},
author = {Avrim Blum and Lunjia Hu},
journal= {arXiv preprint arXiv:1711.00388},
year = {2017}
}