中文

差分隐私分层文本分类中的隐私-效用权衡

密码学与安全 2021-12-10 v2 计算与语言 机器学习

摘要

分层文本分类旨在将文本文档分类到类与子类的层级结构中。尽管人工神经网络已被证明可有效执行该任务,但不幸的是,由于对训练数据的记忆,它们可能向对手泄露训练数据信息。在模型训练中使用差分隐私可缓解针对已训练模型的泄露攻击,使模型得以安全共享,代价是模型精度下降。本工作研究具差分隐私保证的分层文本分类中的隐私-效用权衡,并识别出提供较优权衡的神经网络架构。为此,我们使用白盒成员推断攻击来经验评估三种广泛使用的神经网络架构的信息泄露。我们表明,较大的差分隐私参数已足以完全缓解成员推断攻击,从而仅导致模型效用的适度下降。更具体地,对于含长文本的大型数据集,我们观察到基于 Transformer 的模型实现了总体有利的隐私-效用权衡,而对于含较短文本的较小数据集,卷积神经网络更可取。

关键词

引用

@article{arxiv.2103.02895,
  title  = {On the privacy-utility trade-off in differentially private hierarchical text classification},
  author = {Dominik Wunderlich and Daniel Bernau and Francesco Aldà and Javier Parra-Arnau and Thorsten Strufe},
  journal= {arXiv preprint arXiv:2103.02895},
  year   = {2021}
}