机器学习中的数据最小化系统综述
机器学习
2026-02-19 v2 密码学与安全
摘要
数据最小化 (DM) 描述的是仅收集完成特定任务所严格必要的数据的原则。这一原则是 GDPR 和 CPRA 等主要数据保护法规中的基础原则之一。违反这一原则会导致重大的现实后果,监管行动结果可产生数亿美元的罚款。值得注意的是,数据最小化的相关性在机器学习 (ML) 应用中尤为突出,这些应用通常依赖大规模数据集,导致了一个新的研究领域,即机器学习中的数据最小化 (DMML)。与此同时,现有关于其他 ML 隐私和安全议题的工作往往在不明确承认与 DMML 关联的情况下,解答了与 DMML 相关的关注问题。这种断裂导致从业实践者困惑,使其在实施 DM 原则和解释不同研究社区使用的术语、指标和评估标准方面受到阻碍。为弥合这一差距,我们提出了 DMML 领域首个知识系统化 (SoK)。我们引入了一个涵盖统一数据管道、对抗模型和最小化点点的通用 DMML 框架。该框架使我们能够系统性地审阅数据最小化文献以及那些往往被忽略与 DM 关联的邻近方法。我们的结构化概览旨在帮助实践者和研究者通过 DM 视角有效采纳和应用 DM 原则,通过识别相关技术并理解底层假设和权衡来实现此目标。
引用
@article{arxiv.2508.10836,
title = {SoK: Data Minimization in Machine Learning},
author = {Robin Staab and Nikola Jovanović and Kimberly Mai and Prakhar Ganesh and Martin Vechev and Ferdinando Fioretto and Matthew Jagielski},
journal= {arXiv preprint arXiv:2508.10836},
year = {2026}
}
备注
Accepted at IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) 2026