中文

关于混合分布的检测及其在最偏硬币问题中的应用

机器学习 2016-03-29 v1

摘要

本文研究了两种纯探索——广度与深度——之间的权衡。最偏硬币问题询问从一个包含“重”币(均值 θ1(0,1)\theta_1 \in (0,1))和“轻”币(均值 θ0(0,θ1)\theta_0 \in (0,\theta_1))的无限袋中识别一枚“重”币需要多少次总硬币抛掷,其中重币从袋中抽取的概率为 α(0,1/2)\alpha \in (0,1/2)。该问题的关键难点在于区分两类硬币是否具有非常相近的均值,还是重币极其罕见。该问题在众包、异常检测和射频频谱搜索中有应用。Chandrasekaran 等人(2014)最近提出了该问题的一个解决方案,但需要完美知道 θ0,θ1,α\theta_0,\theta_1,\alpha。相反,我们推导了适应问题参数部分或完全未知知识的算法。此外,我们的技术推广到超出硬币的更一般无限多臂 bandit 问题实例。我们还证明了下界,显示我们算法的上界紧至 log\log 因子,并顺带刻画了区分单一参数分布与两个此类分布混合物的样本复杂度。因此,这些界对最偏硬币问题的解以及仅已知参数部分信息时的异常检测都具有令人惊讶的启示。

关键词

引用

@article{arxiv.1603.08037,
  title  = {On the Detection of Mixture Distributions with applications to the Most Biased Coin Problem},
  author = {Kevin Jamieson and Daniel Haas and Ben Recht},
  journal= {arXiv preprint arXiv:1603.08037},
  year   = {2016}
}