从粗标签中学习的高效算法
机器学习
2023-03-27 v2 数据结构与算法
机器学习
摘要
对于许多学习问题,人们可能无法获得细粒度标签信息;例如,根据标注者的专业水平,一幅图像可被标注为哈士奇、狗、甚至动物。在这项工作中,我们形式化了这些设定并研究从此类粗数据中学习的问题。我们并非观察来自集合 的实际标签,而是观察对应于 的一个划分(或划分的混合)的粗标签。我们的主要算法结果是:本质上,任何可从细粒度标签学习的问题,在粗数据信息充分时也能被高效学习。我们通过一个通用归约获得该结果,用于在仅给定粗标签的情况下回答关于细粒度标签的统计查询(SQ)。所需粗标签的数量取决于因粗化导致的信息失真以及细标签数量 的多项式关系。我们还研究了(无穷多)实值标签的情况,聚焦于审查与截断统计中的一个核心问题:从粗数据的高斯均值估计。当划分中的集合为凸时我们提供了高效算法,并证明即便对非常简单的非凸集合该问题也是 NP 难的。
引用
@article{arxiv.2108.09805,
title = {Efficient Algorithms for Learning from Coarse Labels},
author = {Dimitris Fotakis and Alkis Kalavasis and Vasilis Kontonis and Christos Tzamos},
journal= {arXiv preprint arXiv:2108.09805},
year = {2023}
}