中文

通过学习缩放定律限制数据收集:数据最小化法律原则的计算解释

机器学习 2022-06-14 v2 计算机与社会 信息检索

摘要

现代机器学习系统日益以广泛的个人数据收集为特征,尽管此类做法的收益递减且社会成本递增。然而,数据最小化是欧盟《通用数据保护条例》(“GDPR”)所确立的核心数据保护原则之一,要求仅处理适当、相关且限于必要范围的个人数据。然而,由于缺乏技术解释,该原则采用有限。本工作中,我们基于机器学习与法律文献,提出 FIDO(抑制数据过度收集框架,Framework for Inhibiting Data Overcollection)。FIDO 基于与系统性能相关的数据最小化解释来学习限制数据收集。具体而言,FIDO 通过随着数据获取迭代更新性能曲线(即数据集规模与性能之间的关系)的估计,提供数据收集停止准则。FIDO 通过分段幂律技术估计性能曲线,该技术分别建模算法在数据收集过程中不同阶段的性能。实证实验表明,该框架在跨数据集与特征获取算法下生成准确的性能曲线与数据收集停止准则。我们进一步证明许多其他曲线族会系统性高估额外数据的回报。我们的调研结果与分析深入揭示了设计数据最小化框架时的相关考量,包括主动特征获取对个体用户的影响以及用户特定数据最小化的可行性。我们以数据最小化实施的实用建议作结。

关键词

引用

@article{arxiv.2107.08096,
  title  = {Learning to Limit Data Collection via Scaling Laws: A Computational Interpretation for the Legal Principle of Data Minimization},
  author = {Divya Shanmugam and Samira Shabanian and Fernando Diaz and Michèle Finck and Asia Biega},
  journal= {arXiv preprint arXiv:2107.08096},
  year   = {2022}
}

备注

To appear at ACM Conference on Fairness, Accountability, and Transparency, 2022