一种面向增广类别的偏标记学习无偏风险估计器
机器学习
2024-10-01 v1 人工智能
机器学习
摘要
偏标记学习(Partial Label Learning, PLL)是一种典型的弱监督学习任务,它假设每个训练样本被标注为一组包含真实标签的候选标签集。近期的 PLL 方法采用基于识别的消歧来减轻假阳性标签的影响,并取得了令人瞩目的性能。然而,这些方法要求测试集中的所有类别都已在训练集中出现,忽略了实际应用中会不断涌现新类别的事实。为了解决这个问题,本文聚焦于增广类别的偏标签学习(Partial Label Learning with Augmented Class, PLLAC)问题,其中一个或多个增广类别在训练阶段不可见,但在推理阶段出现。具体而言,我们为 PLLAC 提出了一种具有理论保证的无偏风险估计器,该估计器通过从未标记数据中区分已知类别的分布来估计增广类别的分布,并且可以配备任意的 PLL 损失函数。此外,我们对该估计器的估计误差界进行了理论分析,保证了当训练数据量趋于无穷时,经验风险最小化器能收敛到真实风险最小化器。更进一步,我们在优化目标中加入了一个风险惩罚正则化项,以减轻由负经验风险引起的过拟合问题的影响。在基准数据集、UCI 数据集和真实世界数据集上的大量实验证明了所提方法的有效性。
引用
@article{arxiv.2409.19600,
title = {An Unbiased Risk Estimator for Partial Label Learning with Augmented Classes},
author = {Jiayu Hu and Senlin Shu and Beibei Li and Tao Xiang and Zhongshi He},
journal= {arXiv preprint arXiv:2409.19600},
year = {2024}
}
备注
17 pages