在加密文本上训练自然语言处理模型以增强隐私
计算与语言
2023-05-08 v1 人工智能
密码学与安全
摘要
随着基于云的服务在机器学习模型训练与部署中的日益使用,数据隐私已成为一个主要关切。这对于自然语言处理(NLP)模型尤为关键,其常处理如个人通信与机密文档等敏感信息。在本研究中,我们提出一种在加密文本数据上训练 NLP 模型的方法,以在保持与非加密数据训练的模型相近性能的同时缓解数据隐私担忧。我们使用两种不同架构(即 Doc2Vec+XGBoost 与 Doc2Vec+LSTM)演示该方法,并在 20 Newsgroups 数据集上评估模型。我们的结果表明,加密与非加密模型均取得可比性能,说明我们的加密方法在保持模型精度的同时有效保护了数据隐私。为复现实验,我们提供了如下地址的 Colab notebook:https://t.ly/lR-TP
引用
@article{arxiv.2305.03497,
title = {Training Natural Language Processing Models on Encrypted Text for Enhanced Privacy},
author = {Davut Emre Tasar and Ceren Ocal Tasar},
journal= {arXiv preprint arXiv:2305.03497},
year = {2023}
}
备注
3 pages