中文

基于双比例约束的标签比例学习

机器学习 2026-03-24 v1

摘要

学习标签比例 (Learning from Label Proportions, LLP) 是一种弱监督问题,其训练数据由袋子组成,即包含多个实例的组块,仅标注有袋级类别比例,目标是学习一个预测实例级标签的分类器。这种设置在隐私限制限制访问实例级标注或细粒度标注成本高昂且不可行时广泛适用。本文引入一种方法,利用双比例约束 (Dual proportion Constraints, LLP-DC) 在训练过程中进行约束,分别在袋级和实例级强制执行。具体而言,袋级训练将预测均值与给定比例对齐,实例级训练则将满足比例约束的硬伪标签对齐,其中采用最小费用最大流算法生成硬伪标签。广泛的实验结果表明,LLP-DC在各种基准数据集上 consistently 优于以前的LLP方法,无论数据集大小或袋大小如何。代码已公开于https://github.com/TianhaoMa5/CV PR2026_Findings_LLP_DC。

关键词

引用

@article{arxiv.2603.21153,
  title  = {Learning from Label Proportions with Dual-proportion Constraints},
  author = {Tianhao Ma and Ximing Li and Changchun Li and Renchu Guan},
  journal= {arXiv preprint arXiv:2603.21153},
  year   = {2026}
}