中文

存在损坏时的学习

机器学习 2015-07-07 v2 机器学习

摘要

在监督学习中,人们希望通过提供一个从实例到标签的函数 ff 来识别联合分布 PP(实例、标签对)中存在的模式,该函数具有低风险 EP(y,f(x))\mathbb{E}_{P}\ell(y,f(x))。为此,学习者可获得从 PP 抽取的 nn 个独立同分布样本。在许多现实问题中,干净样本不可用。相反,学习者获得来自损坏分布 P~\tilde{P} 的样本进行学习,而预测干净模式的目标保持不变。可以考虑许多不同类型的损坏,且迄今为止没有通用方法比较在这些不同损坏过程下学习的相对难易程度。在本文中,我们开发了一个处理此类问题的通用框架,并引入了存在损坏时学习风险的上界和下界。我们的最终目标是能够在数据集获取方面做出明智的经济决策。对于某类损坏过程(那些\emph{可重建的}),我们在特定意义上实现了该目标。我们的下界用遍历系数表示,这是随机矩阵的一个易于计算的属性。我们的上界通过推广 Natarajan 等人近期工作以及 Kearns 早期工作中隐含的无偏估计量方法得到。

关键词

引用

@article{arxiv.1504.00091,
  title  = {Learning in the Presence of Corruption},
  author = {Brendan van Rooyen and Robert C. Williamson},
  journal= {arXiv preprint arXiv:1504.00091},
  year   = {2015}
}