中文

从粗标签中学习的高效算法

机器学习 2023-03-27 v2 数据结构与算法 机器学习

摘要

对于许多学习问题,人们可能无法获得细粒度标签信息;例如,根据标注者的专业水平,一幅图像可被标注为哈士奇、狗、甚至动物。在这项工作中,我们形式化了这些设定并研究从此类粗数据中学习的问题。我们并非观察来自集合 Z\mathcal{Z} 的实际标签,而是观察对应于 Z\mathcal{Z} 的一个划分(或划分的混合)的粗标签。我们的主要算法结果是:本质上,任何可从细粒度标签学习的问题,在粗数据信息充分时也能被高效学习。我们通过一个通用归约获得该结果,用于在仅给定粗标签的情况下回答关于细粒度标签的统计查询(SQ)。所需粗标签的数量取决于因粗化导致的信息失真以及细标签数量 Z|\mathcal{Z}| 的多项式关系。我们还研究了(无穷多)实值标签的情况,聚焦于审查与截断统计中的一个核心问题:从粗数据的高斯均值估计。当划分中的集合为凸时我们提供了高效算法,并证明即便对非常简单的非凸集合该问题也是 NP 难的。

关键词

引用

@article{arxiv.2108.09805,
  title  = {Efficient Algorithms for Learning from Coarse Labels},
  author = {Dimitris Fotakis and Alkis Kalavasis and Vasilis Kontonis and Christos Tzamos},
  journal= {arXiv preprint arXiv:2108.09805},
  year   = {2023}
}