中文

非独立同分布数据的色度 PAC-Bayes 界:在排序和稳态 $\beta$-混合过程中的应用

机器学习 2010-06-09 v2 统计理论 机器学习 统计理论

摘要

PAC-Bayes 界是独立同分布数据学习所得分类器最精确的泛化界之一,对于间隔分类器尤其如此:近期有贡献展示了这些界在模型选择 (Ambroladze 等人, 2007) 甚至直接指导线性分类器学习 (Germain 等人, 2009) 方面的实用性。然而,在许多实际情况下,训练数据表现出某种依赖性,传统的独立同分布假设不成立。因此,从理论和实践的角度来看,为这类框架陈述泛化界都具有极大的意义。在这项工作中,我们提出了——据我们所知——首个针对在具有相互依赖性的数据上训练的分类器的 PAC-Bayes 泛化界。建立我们结果所采用的方法基于对一个所谓依赖图的分解,该图通过图分数覆盖对数据中的依赖性进行编码,将其分解为独立数据集合。我们的界非常通用,因为只要能够找到依赖图分数色数的上界,就足以得到针对特定设置的新 PAC-Bayes 界。我们展示了如何利用我们的结果推导出针对排序统计量(如 AUC)以及根据稳态 β\beta-混合过程分布的数据训练的分类器的界。在此过程中,我们展示了我们的方法如何无缝地处理 U-过程。作为附注,我们还为根据稳态 φ\varphi-混合分布数据学习的分类器提供了一个 PAC-Bayes 泛化界。

关键词

引用

@article{arxiv.0909.1933,
  title  = {Chromatic PAC-Bayes Bounds for Non-IID Data: Applications to Ranking and Stationary $\beta$-Mixing Processes},
  author = {Liva Ralaivola and Marie Szafranski and Guillaume Stempfel},
  journal= {arXiv preprint arXiv:0909.1933},
  year   = {2010}
}

备注

Long version of the AISTATS 09 paper: http://jmlr.csail.mit.edu/proceedings/papers/v5/ralaivola09a/ralaivola09a.pdf