中文

模仿与分类:一种条件独立性检验的元算法

机器学习 2018-06-27 v1 机器学习

摘要

给定由联合分布 p(x,y,z)p(\mathbf{x},\mathbf{y},\mathbf{z}) 生成的独立样本,我们研究条件独立性(CI 检验)问题,即联合分布是否等于 CI 分布 pCI(x,y,z)=p(z)p(yz)p(xz)p^{CI}(\mathbf{x},\mathbf{y},\mathbf{z})= p(\mathbf{z}) p(\mathbf{y}|\mathbf{z})p(\mathbf{x}|\mathbf{z})。我们将此问题置于所提出的、可证明的元算法“模仿与分类”之下,该算法分两步实现:(a)足够接近地模仿 CI 分布以恢复其支撑;(b)分类以区分联合分布与 CI 分布。因此,只要我们有一个好的生成模型和一个好的分类器,我们就潜在地拥有一个可靠的 CI 检验器。借助这一模块化范式,CI 检验变得易于由深度学习现代进展中先进的生成与分类方法来处理,这些方法通常能应对维数灾难与小样本体制下的问题。我们在合成与真实数据集上展示了密集的数值实验,其中条件 GAN、神经网络回归等新的模仿方法优于文献中当前最佳的 CI 检验性能。我们的理论结果提供了对零分布估计的分析,并允许一般的测度,即当部分随机变量为离散而部分为连续,或其中一个或多个为离散-连续混合时。

关键词

引用

@article{arxiv.1806.09708,
  title  = {Mimic and Classify : A meta-algorithm for Conditional Independence Testing},
  author = {Rajat Sen and Karthikeyan Shanmugam and Himanshu Asnani and Arman Rahimzamani and Sreeram Kannan},
  journal= {arXiv preprint arXiv:1806.09708},
  year   = {2018}
}

备注

16 pages, 2 figures