大规模最近邻分类的收敛速率
机器学习
2019-11-01 v2 机器学习
统计理论
统计理论
摘要
最近邻是一类流行的分类方法,具有许多优良性质。对于因计算、通信、隐私或所有权限制而无法载入单机内存的大规模数据集,我们考虑分治策略:将整个数据集划分为小子集,在各子集上做最近邻预测,然后通过多数投票汇总子集预测得到最终决策。我们将此方法命名为大最近邻(bigNN)分类器,并在最小假设下给出其收敛速率,涵盖超额风险与分类不稳定性两方面,证明其与预言最近邻分类器速率相同且无法改进。为显著减少达到最优速率所需的预测时间,我们还考虑将预训练加速技术应用于bigNN方法,并证明其收敛速率。我们发现,在分布式设置中,邻居数的最优选择应随总样本量与划分块数共同缩放,且后者存在理论上限。数值研究已验证理论发现。
引用
@article{arxiv.1909.01464,
title = {Rates of Convergence for Large-scale Nearest Neighbor Classification},
author = {Xingye Qiao and Jiexin Duan and Guang Cheng},
journal= {arXiv preprint arXiv:1909.01464},
year = {2019}
}
备注
Camera ready version for NeurIPS