中文

最近邻算法中插值的好处

机器学习 2022-02-25 v1 机器学习

摘要

在一些深度学习研究 \citep[e.g.,][]{zhang2016understanding} 中,观察到过参数化深度神经网络即使在训练误差几乎为零时也能取得较小的测试误差。尽管已有大量工作致力于理解这一所谓的“双下降”现象 \citep[e.g.,][]{belkin2018reconciling,belkin2019two},本文中我们转向另一种无需过参数化即可强制零训练误差的途径,即通过数据插值机制。具体而言,我们考虑最近邻(NN)算法中的一类插值加权方案。通过仔细刻画统计风险中的乘性常数,我们揭示了在分类与回归设定下数据插值程度对应的 U 形性能曲线。这细化了现有结果 \citep{belkin2018does}——零训练误差未必损害预测性能,并给出一个反直觉结论:适度程度的数据插值实际上会较(未插值的)kk-NN 算法严格改善预测性能与统计稳定性。最后,我们还将讨论结果的普适性,如距离度量的改变与受污染的测试数据。

关键词

引用

@article{arxiv.2202.11817,
  title  = {Benefit of Interpolation in Nearest Neighbor Algorithms},
  author = {Yue Xing and Qifan Song and Guang Cheng},
  journal= {arXiv preprint arXiv:2202.11817},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:1909.11720