基于隐私保护 BERT 的自然语言理解
计算与语言
2021-08-23 v2
摘要
隐私保护仍是数据挖掘与自然语言理解(NLU)中的关键挑战。先前研究表明输入文本甚至文本嵌入会泄露隐私信息。这一担忧促使我们研究预训练语言模型(LMs)的有效隐私保护方法。我们考察了在 NLU 应用中对 BERT 微调应用 dx-privacy(局部差分隐私的一种变体)的隐私与效用影响。更重要的是,我们进一步提出隐私自适应 LM 预训练方法,并表明我们的方法能在保持相同隐私保护水平的同时显著提升 BERT 的效用。我们还量化了隐私保护水平并给出隐私配置指导。我们的实验与发现为未来利用预训练 LMs 进行隐私保护 NLU 的探索奠定基础。
引用
@article{arxiv.2104.07504,
title = {Natural Language Understanding with Privacy-Preserving BERT},
author = {Chen Qu and Weize Kong and Liu Yang and Mingyang Zhang and Michael Bendersky and Marc Najork},
journal= {arXiv preprint arXiv:2104.07504},
year = {2021}
}
备注
Accepted to CIKM 2021