中文

解释最近邻方法在预测中的成功之处

机器学习 2025-02-25 v1 机器学习

摘要

许多现代预测方法利用最近邻搜索找到与测试示例最相似的过去训练示例,这一思想最早可追溯至公元 11 世纪,并且经受住了时间的考验。本书旨在解释这些方法的成功原因,无论是在理论上,我们涵盖了关于最近邻基于回归和分类的非渐近统计保证,还是在实践中,我们收集了用于近似最近邻搜索的著名方法,这些方法对扩展依赖于最近邻分析的预测系统以处理大数据集至关重要。此外,我们讨论了学习距离以与最近邻方法配合的技术,包括随机决策树和集成方法如何学习最近邻结构,以及众包和图谱 (graphons) 的最新进展。在理论方面,我们关注非渐近统计保证,这些保证以如何确定所需的训练数据量和算法参数以确保最近邻预测方法实现用户指定的误差容忍度的形式呈现。我们首先从最一般的这些结果开始,针对最近邻及相关核回归和分类在一般度量空间中的情况。在此类情境中,我们假设结构极少,成功预测的关键在于被估计函数的光滑性,以及落在决策边界附近的概率较低。对于分类任务而言,这些条件在实际数据集中可能难以验证。随后,我们涵盖了在时间序列预测、面向时间的人推荐产品、以及通过查看医学图像中图像块来描绘人体器官等案例研究中的最近邻预测的最新保证。在这些案例研究中,聚类结构使成功预测成为可能。

关键词

引用

@article{arxiv.2502.15900,
  title  = {Explaining the Success of Nearest Neighbor Methods in Prediction},
  author = {George H. Chen and Devavrat Shah},
  journal= {arXiv preprint arXiv:2502.15900},
  year   = {2025}
}

备注

Originally published on May 31, 2018 in Foundations and Trends in Machine Learning; this revised version fixes some proof details for k-NN and fixed-radius NN regression and classification