量化红acted文本隐私的可行方法
机器学习
2024-10-11 v1
摘要
本文提出一种类似k匿名(k-anonymity)的方法用于评估红acted文本的隐私。给定一段红acted文本,我们使用最先进的基于变换器的深度学习网络来重建原始文本。这会生成与红acted文本一致的多个完整文本,即语法正确、具有相同的非红acted单词等,并将这些文本表示为捕获句子相似性的嵌入向量。通过这种方式,我们可以估计与红acted文本一致的完整文本的数量、多样性和质量,从而评估其隐私。
引用
@article{arxiv.2410.07772,
title = {Towards Quantifying The Privacy Of Redacted Text},
author = {Vaibhav Gusain and Douglas Leith},
journal= {arXiv preprint arXiv:2410.07772},
year = {2024}
}
备注
Accepted in ECIR'23