协同过滤中数据最小化与公平性之间的权衡
信息检索
2024-10-11 v1 计算机与社会
机器学习
摘要
通用数据保护法规(GDPR)旨在保护个人信息免受伤害。虽然在欧盟和加州隐私权法案(CPRA)中强制遵守,但在其他地区并非如此。GDPR要求同时遵守诸如公平性、准确性和数据最小化等所有原则。然而,它忽略了这些原则之间潜在的矛盾。当需要对决策系统进行合规时,这种情况变得更加复杂。因此,调查同时实现GDPR目标和机器学习可能性,以及可能被迫使用的权衡是必要的。本文研究了数据最小化和推荐系统中公平性之间的关系。我们通过主动学习(AL)来实现数据最小化,因为与其他许多方法不同,它可以在保持高准确率的同时进行战略性数据收集,从而最小化数据收集。我们实现了几种主动学习策略(个性化和非个性化),并在两个公开可用数据集上进行了关注准确性和公平性的比较分析。结果表明,不同的AL策略对推荐系统的准确性影响不同,几乎所有策略都会对公平性产生负面影响。关于数据最小化与公平性之间的权衡、主动学习方法作为实现数据最小化工具的利弊,以及AL对公平性的潜在影响方面的工作尚未广泛开展。通过探索这些关键方面,我们为开发符合GDPR要求的推荐系统提供了宝贵的见解。
引用
@article{arxiv.2410.07182,
title = {The trade-off between data minimization and fairness in collaborative filtering},
author = {Nasim Sonboli and Sipei Li and Mehdi Elahi and Asia Biega},
journal= {arXiv preprint arXiv:2410.07182},
year = {2024}
}