中文

纵向联邦学习的数据估值:一种无模型且隐私保护的方法

机器学习 2024-01-05 v3 人工智能

摘要

纵向联邦学习(VFL)是一种有前景的预测分析范式,使一个组织(即任务方)能够以去中心化且隐私保护的方式通过与多个数据供应方(即数据方)协作来增强其预测模型。尽管对 VFL 的兴趣快速增长,但缺乏有效且安全的工具来评估数据方所拥有数据的价值,阻碍了 VFL 在业务场景中的应用。为此,我们提出 FedValue,一种用于 VFL 的隐私保护、任务特定但无模型的数据估值方法,其由数据估值度量和联邦计算方法组成。具体而言,我们首先引入一种新颖的数据估值度量,即 MShapley-CMI。该度量无需执行机器学习模型即可评估数据方对预测分析任务的贡献,使其非常适合于 VFL 的实际应用。接下来,我们开发了一种创新的联邦计算方法,以隐私保护方式为每个数据方计算 MShapley-CMI 值。在六个公开数据集上进行的广泛实验验证了 FedValue 在 VFL 背景下数据估值的有效性。此外,我们通过一个涉及联邦电影推荐的案例研究说明了 FedValue 的实际效用。

关键词

引用

@article{arxiv.2112.08364,
  title  = {Data Valuation for Vertical Federated Learning: A Model-free and Privacy-preserving Method},
  author = {Xiao Han and Leye Wang and Junjie Wu and Xiao Fang},
  journal= {arXiv preprint arXiv:2112.08364},
  year   = {2024}
}