DeRDaVa:面向机器学习的删除鲁棒数据估值
机器学习
2024-01-23 v2 人工智能
摘要
数据估值旨在确定来自数据源的数据的公平估值,以对其进行补偿或识别对预测最有用或最无用的训练样本。随着对个人数据所有权和数据保护法规的兴趣日益浓厚,模型所有者可能不得不履行更多的数据删除请求。这引发了现有工作尚未解决的问题:数据估值分数在删除后是否仍然公平?是否必须昂贵地重新计算分数?答案是否定的。为了避免重新计算,我们建议预先使用我们的数据估值框架 DeRDaVa 来评估每个数据源在预期数据删除后对保持鲁棒模型性能的贡献。DeRDaVa 可以被高效近似,并将为更有用或更不可能被删除的数据分配更高的值。我们进一步将 DeRDaVa 推广为 Risk-DeRDaVa,以满足关注最坏/最佳情况模型效用的风险规避/寻求型模型所有者的需求。我们还通过实证展示了我们解决方案的实用性。
引用
@article{arxiv.2312.11413,
title = {DeRDaVa: Deletion-Robust Data Valuation for Machine Learning},
author = {Xiao Tian and Rachael Hwee Ling Sim and Jue Fan and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2312.11413},
year = {2024}
}