中文

从聚合标签进行弱到强学习

机器学习 2024-11-12 v1 数据结构与算法 机器学习

摘要

在聚合标签学习中,训练数据由一组特征向量(实例)的集合(“包袱”)组成,每组包袱附带一个来自其实例标签(通常为{0,1})的聚合标签。在标签比例学习(LLP)中,聚合标签是包袱中实例标签的平均值,而在多实例学习(MIL)中,则是其中的或运算。目标是训练一个实例级别的预测器,通常通过拟合模型来实现,这包括最大化准确率,即满足的包袱比例,即预测标签与聚合标签一致的包袱。一个弱学习器在常数准确率下<1,而强学习器的准确率可以无限接近1。我们研究了使用带有聚合标签的训练包袱中的弱学习器来获得强学习器的问题,这类似于监督学习,其中已知 boosting算法。我们的第一个结果表明,由于构造了一组包袱,使得任何准确率<1的弱分类器(对于任何权重分配)都存在,而不容许强学习器,因此在LLP中无法进行 boosting。该构造的变体也否定了在MIL中对非平凡弱学习器准确率范围内的 boosting。在LLP设置下,我们展示,具有小准确率的弱学习器在足够大的包袱上,实际上可以用于获得小包袱的强学习器,时间复杂度为多项式。我们还提供了我们程序的更高效、基于抽样的变体,并对其具有概率保证,这在三个真实数据集和两个合成数据集上进行了经验验证。我们的工作是首次对从聚合标签进行弱到强学习进行理论研究,同时提供一个实现LLP的算法,同时证明了LLP和MIL的 boosting不可行。

关键词

引用

@article{arxiv.2411.06200,
  title  = {Weak to Strong Learning from Aggregate Labels},
  author = {Yukti Makhija and Rishi Saket},
  journal= {arXiv preprint arXiv:2411.06200},
  year   = {2024}
}

备注

19 pages