中文

从聚合响应中学习:实例级与包级损失函数

机器学习 2024-01-23 v1 人工智能 统计理论 机器学习 统计理论

摘要

由于隐私问题的兴起,在许多实际应用中,训练数据在与学习者共享之前会被聚合,以保护用户敏感响应的隐私。在聚合学习框架中,数据集被分组为样本包,其中每个包仅提供聚合响应,给出该包中个体响应的摘要。在本文中,我们研究了两种用于从聚合响应中学习的自然损失函数:包级损失和实例级损失。前者通过最小化聚合响应与聚合模型预测之间的损失来学习模型,而后者旨在使个体预测拟合聚合响应。在本研究中,我们表明实例级损失可以被视为包级损失的正则化形式。这一观察结果使我们能够从结果估计量的偏差和方差方面比较这两种方法,并引入一种结合这两种方法的新型插值估计量。对于线性回归任务,我们在训练集大小与特征维度成比例增长的渐近状态下,对插值估计量的风险进行了精确表征。我们的分析使我们在理论上理解了不同因素(如包大小)对模型预测风险的影响。此外,我们提出了一种从聚合响应中进行差分隐私学习的机制,并推导出了在预测风险-隐私权衡方面最优的包大小。我们还进行了全面的实验以证实我们的理论,并展示了插值估计量的有效性。

关键词

引用

@article{arxiv.2401.11081,
  title  = {Learning from Aggregate responses: Instance Level versus Bag Level Loss Functions},
  author = {Adel Javanmard and Lin Chen and Vahab Mirrokni and Ashwinkumar Badanidiyuru and Gang Fu},
  journal= {arXiv preprint arXiv:2401.11081},
  year   = {2024}
}

备注

To appear in the Twelfth International Conference on Learning Representations (ICLR 2024)