TextHide:应对语言理解任务中的数据隐私问题
计算与语言
2020-10-14 v1 密码学与安全
数据结构与算法
机器学习
机器学习
摘要
分布式或联邦学习中的一个未解挑战是,如何在不拖慢训练或降低精度的情况下有效缓解隐私风险。本文提出TextHide,旨在解决自然语言理解任务中的这一挑战。它要求所有参与者增加一个简单加密步骤,以防止窃听攻击者恢复私有文本数据。该加密步骤高效且仅轻微影响任务性能。此外,TextHide很好地契合微调预训练语言模型(如BERT)这一流行框架,适用于任意句子或句子对任务。我们在GLUE基准上评估TextHide,实验表明TextHide能有效防御针对共享梯度或表示的攻击,且平均精度下降仅。我们还基于一个关于某数学问题计算难解性的猜想,对TextHide的安全性进行了分析。我们的代码可在 https://github.com/Hazelsuko07/TextHide 获取。
引用
@article{arxiv.2010.06053,
title = {TextHide: Tackling Data Privacy in Language Understanding Tasks},
author = {Yangsibo Huang and Zhao Song and Danqi Chen and Kai Li and Sanjeev Arora},
journal= {arXiv preprint arXiv:2010.06053},
year = {2020}
}
备注
Findings of EMNLP 2020