中文

从 N 元组数据中学习:无偏风险估计与理论保证

机器学习 2025-11-11 v2 人工智能

摘要

弱监督学习通常依赖粗糙的聚合信号而非实例标签。我们研究一种场景:每个训练样本为包含恰好 m 个正例的 n 元组,仅观测到每个元组的计数 m。这种 NTMP(N-tuple with M positives)监督方式在例如基于区域提议的图像分类和多实例测量中出现。我们表明,通过将元组生成过程关联到潜在实例边缘分布,可构建可训练的无偏风险估计器(URE)。从固定 (n,m) 参数出发,推导闭式 URE,并扩展至可变元组大小、可变计数及其组合。只要有效混合率与类别先验分离,即可保证识别成立。我们通过 Rademacher 复杂度建立泛化界限,并在 mild 正则性假设下证明其与标准方法的统计一致性。为改善有限样本稳定性,我们引入简单的 ReLU 修正,保持渐近正确性。在转化为 NTMP 任务的基准测试上,该方法持续优于代表性弱监督基线,实现 F1 分数和精确率-召回率的最佳权衡。该方法在类别先验不平衡和多样化元组配置下均表现出鲁棒性,证明仅凭计数信息即可通过理论严谨且实践稳定的目标函数有效利用。

关键词

引用

@article{arxiv.2510.18406,
  title  = {Learning from N-Tuple Data with M Positive Instances: Unbiased Risk Estimation and Theoretical Guarantees},
  author = {Miao Zhang and Junpeng Li and ChangChun HUa and Yana Yang},
  journal= {arXiv preprint arXiv:2510.18406},
  year   = {2025}
}