中文

ppAURORA:保护隐私的接收者操作特征曲线下面积与精确率-召回率曲线下面积

机器学习 2023-06-16 v3 密码学与安全

摘要

计算 AUC 作为比较不同机器学习模型质量的性能度量,是许多研究项目的最后步骤之一。这些方法中许多在隐私敏感数据上训练,若数据集不能共享或在一处联合用于训练和/或测试,则有若干不同方法如 ϵ\epsilon-差分隐私、联邦机器学习与密码学。在此设定下,计算全局 AUC 也可能成为问题,因为标签也可能包含隐私敏感信息。已有基于 ϵ\epsilon-差分隐私的方法解决该问题,但据我们所知,尚未提出精确的隐私保护方案。本文中,我们提出一种基于 MPC 的方案,称为 ppAURORA,通过对来自多方的独立排序列表进行私有合并,计算如同在合并原始测试样本上所能获得的精确 AUC。借助 ppAURORA,即便预测置信值间存在并列,也可计算精确率-召回率曲线与接收者操作特征曲线下的精确面积。我们使用 ppAURORA 评估分别预测急性髓系白血病治疗响应与心脏病的两种不同模型。我们还通过合成数据实验评估其可扩展性。所有这些实验表明,根据半诚实敌手设定,我们高效且私有地计算出与在明文合并测试样本上所得完全相同的两种评估度量下的 AUC。

关键词

引用

@article{arxiv.2102.08788,
  title  = {ppAURORA: Privacy Preserving Area Under Receiver Operating Characteristic and Precision-Recall Curves},
  author = {Ali Burak Ünal and Nico Pfeifer and Mete Akgün},
  journal= {arXiv preprint arXiv:2102.08788},
  year   = {2023}
}

备注

Accepted in NSS-SocialSec 2023