中文

关于从标签比例中学习

机器学习 2015-02-13 v2 机器学习

摘要

从标签比例中学习 (LLP) 是一种学习设定,其中训练数据以组或“袋”的形式提供,且仅已知每个袋中各类别的比例。任务是学习一个模型来预测单个实例的类别标签。LLP 在政治学、市场营销、医疗保健和计算机视觉中有着广泛的应用。本工作通过引入一个通用框架——经验比例风险最小化 (EPRM),回答了 LLP 何时以及为何可能这一基本问题。EPRM 学习一个实例标签分类器以匹配训练数据中给定的标签比例。我们的结果基于两步分析。首先,我们提供了袋比例的泛化误差的 VC 界。我们表明,袋样本复杂度对袋大小仅 mildly 敏感。其次,我们表明在某些温和假设下,良好的袋比例预测能保证良好的实例标签预测。这些结果共同提供了形式化保证,即在 LLP 设定中确实可以学习单个标签。我们讨论了该分析的应用,包括 LLP 算法的合理性、利用总体比例进行学习以及具有隐私保证的学习算法范式。我们还通过一个现实世界案例研究(基于人口普查数据预测收入)展示了 LLP 的可行性。

关键词

引用

@article{arxiv.1402.5902,
  title  = {On Learning from Label Proportions},
  author = {Felix X. Yu and Krzysztof Choromanski and Sanjiv Kumar and Tony Jebara and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:1402.5902},
  year   = {2015}
}