中文

带kNN自调谐核的图拉普拉斯收敛性

统计理论 2021-02-11 v2 机器学习 机器学习 统计理论

摘要

由数据点 {xi}i=1N\{x_i\}_{i=1}^N 构造的核化Gram矩阵 WW,形式为 Wij=k0(xixj2σ2)W_{ij}= k_0( \frac{ \| x_i - x_j \|^2} {\sigma^2} ),被广泛用于基于图的几何数据分析与无监督学习。一个重要问题是如何选择核带宽 σ\sigma,一种称为自调谐核的通用做法通过 kk-最近邻(kNN)距离在每个点 xix_i 处自适应地设定 σi\sigma_i。当 xix_i 采样自嵌入于可能高维空间中的 dd 维流形时,与固定带宽核不同,关于自调谐核的图拉普拉斯收敛性理论结果尚不完整。本文证明了对一新族kNN自调谐核 Wij(α)=k0(xixj2ϵρ^(xi)ρ^(xj))/ρ^(xi)αρ^(xj)αW^{(\alpha)}_{ij} = k_0( \frac{ \| x_i - x_j \|^2}{ \epsilon \hat{\rho}(x_i) \hat{\rho}(x_j)})/\hat{\rho}(x_i)^\alpha \hat{\rho}(x_j)^\alpha 的图拉普拉斯算子 LNL_N 向流形(加权)拉普拉斯的收敛性,其中 ρ^\hat{\rho} 为通过kNN估计的带宽函数,且极限算子也由 α\alpha 参数化。当 α=1\alpha = 1 时,极限算子为加权流形拉普拉斯 Δp\Delta_p。具体地,我们证明了 LNfL_N f 的点态收敛以及图Dirichlet形式的收敛并给出收敛速率。我们的分析首先建立 ρ^\hat{\rho}C0C^0 一致性,以高概率一致地界定相对估计误差 ρ^ρˉ/ρˉ|\hat{\rho} - \bar{\rho}|/\bar{\rho},其中 ρˉ=p1/d\bar{\rho} = p^{-1/d}pp 为数据密度函数。我们的理论结果揭示了自调谐核相比固定带宽核在低密度区域具有更小方差误差的优势。该算法无需 dd 或数据密度的先验知识。理论结果得到模拟数据与手写数字图像数据数值实验的支持。

关键词

引用

@article{arxiv.2011.01479,
  title  = {Convergence of Graph Laplacian with kNN Self-tuned Kernels},
  author = {Xiuyuan Cheng and Hau-Tieng Wu},
  journal= {arXiv preprint arXiv:2011.01479},
  year   = {2021}
}