中文

量化红acted文本隐私的可行方法

机器学习 2024-10-11 v1

摘要

本文提出一种类似k匿名(k-anonymity)的方法用于评估红acted文本的隐私。给定一段红acted文本,我们使用最先进的基于变换器的深度学习网络来重建原始文本。这会生成与红acted文本一致的多个完整文本,即语法正确、具有相同的非红acted单词等,并将这些文本表示为捕获句子相似性的嵌入向量。通过这种方式,我们可以估计与红acted文本一致的完整文本的数量、多样性和质量,从而评估其隐私。

关键词

引用

@article{arxiv.2410.07772,
  title  = {Towards Quantifying The Privacy Of Redacted Text},
  author = {Vaibhav Gusain and Douglas Leith},
  journal= {arXiv preprint arXiv:2410.07772},
  year   = {2024}
}

备注

Accepted in ECIR'23