面向最优与私有学习的数据聚合
机器学习
2024-12-02 v1
摘要
多实例回归(MIR)和从标签比例学习(LLP)是许多应用中出现的学习框架,其中训练数据被划分为互不相交的集合或包袱,学习者仅获得每个包袱的聚合标签(即包袱标签)。在 MIR 框架中,包袱标签是来自包袱中未披露实例的标签;在 LLP 中,包袱标签是包袱标签的均值。本文研究了在 MIR 和 LLP 中各种损失函数下,如何将数据集划分为包袱以最大化下游任务(如线性回归)的实用性。我们理论上提供了实用性保证,表明在每种情况下,最优的分袱策略(近似)可简化为依据 -means 等自然目标对特征向量或标签进行的最优聚类。我们还表明,分袱机制可以实现标签差分隐私,需额外增加实用性误差。我们进一步将结果推广到广义线性模型(GLM)的设置。最后,我们通过实验验证了我们的理论结果。
引用
@article{arxiv.2411.19045,
title = {Aggregating Data for Optimal and Private Learning},
author = {Sushant Agarwal and Yukti Makhija and Rishi Saket and Aravindan Raghuveer},
journal= {arXiv preprint arXiv:2411.19045},
year = {2024}
}
备注
36 pages