从标签比例与协变量偏移实例中学习
机器学习
2025-07-16 v2
摘要
在许多应用中,特别是由于缺乏监督或隐私问题,训练数据被分组为实例(特征向量)的包,并且对于每个包,我们仅有一个从包中实例标签导出的聚合标签。在从标签比例学习(LLP)中,聚合标签是包中实例标签的平均值,并且大量工作集中在 LLP 设置下训练模型以预测实例标签。然而在实践中,训练数据可能包含完全监督但协变量偏移的源数据,以及带有包标签的常规目标数据,我们希望在目标域上训练一个良好的实例级预测器。我们将此称为协变量偏移混合 LLP 问题。完全监督的协变量偏移数据通常具有有用的训练信号,目标是在混合 LLP 设置中利用它们以获得更好的预测性能。为了实现这一点,我们在域适应框架中开发了混合 LLP 方法,这些方法自然地将目标包标签与源实例标签结合在一起。除了证明限制目标泛化误差的理论保证外,我们还在几个公开可用的数据集上进行了实验,表明我们的方法优于 LLP 和域适应基线以及先前相关工作的技术。
引用
@article{arxiv.2411.12334,
title = {Learning from Label Proportions and Covariate-shifted Instances},
author = {Sagalpreet Singh and Navodita Sharma and Shreyas Havaldar and Rishi Saket and Aravindan Raghuveer},
journal= {arXiv preprint arXiv:2411.12334},
year = {2025}
}