中文

平移不变多维分布的密度估计

机器学习 2018-11-12 v1 数据结构与算法 机器学习

摘要

我们研究 Rd\mathbb{R}^d 上平移不变分布类的密度估计。粗略而言,若多维分布在任何方向上与自身的微小平移在总变差距离上接近,则称其为“平移不变”的。平移不变性放宽了非参数密度估计中常用的平滑假设,以允许跳跃不连续性。我们考虑的不同分布类对应于不同的尾部衰减速率。对每一类,我们给出一种高效算法,可从独立样本中学习该类中的任意分布(以总变差距离为度量)。作为我们一般结果的特例,我们证明满足指数尾部界的 dd 维平移不变分布可用 O~d(1/ϵd+2)\tilde{O}_d(1/ \epsilon^{d+2}) 个样本和 O~d(1/ϵ2d+2)\tilde{O}_d(1/ \epsilon^{2d+2}) 时间在总变差距离误差 ϵ\epsilon 内被学习。这意味着,对于常数 dd,多元对数凹分布可在 O~d(1/ϵ2d+2)\tilde{O}_d(1/\epsilon^{2d+2}) 时间内使用 O~d(1/ϵd+2)\tilde{O}_d(1/\epsilon^{d+2}) 个样本被学习,回答了 [Diakonikolas, Kane and Stewart, 2016] 的一个问题。我们所有结果均扩展到使用 Huber 污染模型的噪声容忍密度估计,其中待学习的目標分布是类中某个未知分布与另一个任意未知分布的 (1ϵ,ϵ)(1-\epsilon,\epsilon) 混合,且学习算法必须输出与目標分布总变差距离误差为 O(ϵ)O(\epsilon) 的假设分布。我们通过证明即使在平移不变的有界分布学习上样本复杂度也存在简单的 Ω(1/ϵd)\Omega\left(1/\epsilon^d\right) 信息论下界,表明我们的一般结果接近最优。

关键词

引用

@article{arxiv.1811.03744,
  title  = {Density estimation for shift-invariant multidimensional distributions},
  author = {Anindya De and Philip M. Long and Rocco A. Servedio},
  journal= {arXiv preprint arXiv:1811.03744},
  year   = {2018}
}

备注

Appears in the Proceedings of ITCS 2019