中文

大规模最近邻分类的收敛速率

机器学习 2019-11-01 v2 机器学习 统计理论 统计理论

摘要

最近邻是一类流行的分类方法,具有许多优良性质。对于因计算、通信、隐私或所有权限制而无法载入单机内存的大规模数据集,我们考虑分治策略:将整个数据集划分为小子集,在各子集上做最近邻预测,然后通过多数投票汇总子集预测得到最终决策。我们将此方法命名为大最近邻(bigNN)分类器,并在最小假设下给出其收敛速率,涵盖超额风险与分类不稳定性两方面,证明其与预言最近邻分类器速率相同且无法改进。为显著减少达到最优速率所需的预测时间,我们还考虑将预训练加速技术应用于bigNN方法,并证明其收敛速率。我们发现,在分布式设置中,邻居数kk的最优选择应随总样本量与划分块数共同缩放,且后者存在理论上限。数值研究已验证理论发现。

关键词

引用

@article{arxiv.1909.01464,
  title  = {Rates of Convergence for Large-scale Nearest Neighbor Classification},
  author = {Xingye Qiao and Jiexin Duan and Guang Cheng},
  journal= {arXiv preprint arXiv:1909.01464},
  year   = {2019}
}

备注

Camera ready version for NeurIPS