LLP-Bench:一个用于从标签比例学习的大规模表格基准
机器学习
2024-03-06 v2 机器学习
摘要
在从标签比例学习(LLP)任务中,模型在实例的组(又称袋)及其对应的标签比例上进行训练,以预测单个实例的标签。LLP主要应用于两类数据集——图像和表格。在图像LLP中,通过从底层数据集中随机采样实例来创建固定大小的袋。通过此方法创建的袋称为随机袋。图像LLP的实验大多在CIFAR-*和MNIST数据集的随机袋上进行。尽管LLP在隐私敏感应用中是一项非常关键的任务,表格LLP迄今仍缺乏一个开放的、大规模的LLP基准。表格LLP的一个独特性质是能够创建特征袋,其中袋内所有实例在给定特征上具有相同取值。先前研究已表明,特征袋在实际现实应用中非常普遍[Chen et. al '23, Saket et. al. '22]。本文中,我们解决了缺乏开放的、大规模表格基准的问题。首先,我们提出LLP-Bench,一套由Criteo CTR预测和Criteo赞助搜索转化日志数据集(前者为分类、后者为回归数据集)创建的70个LLP数据集(62个特征袋和8个随机袋数据集)。这些LLP数据集代表了从底层表格数据构建袋的多种方式。据我们所知,LLP-Bench是首个具有组成数据集广泛多样性的大规模表格LLP基准。其次,我们提出四个刻画并量化LLP数据集难度的度量。利用这四个度量,我们对LLP-Bench中的62个特征袋数据集进行了深入分析。最后,我们展示了9种SOTA及流行的表格LLP技术在全部62个数据集上的性能。
引用
@article{arxiv.2310.10096,
title = {LLP-Bench: A Large Scale Tabular Benchmark for Learning from Label Proportions},
author = {Anand Brahmbhatt and Mohith Pokala and Rishi Saket and Aravindan Raghuveer},
journal= {arXiv preprint arXiv:2310.10096},
year = {2024}
}