中文

面向信息管理个人隐私保护的语义保持型文本失真方法

计算与语言 2024-07-10 v3

摘要

近年来,机器学习——尤其是深度学习——对信息管理领域产生了重大影响。尽管已有若干策略被提出以限制模型从原始文本中学习并记忆敏感信息,本文提出了一种更具语言学依据的失真文本方法,在保持语义完整性的同时扭曲文本。为此,我们利用邻近分布散度(Neighboring Distribution Divergence),一种用于评估失真过程中语义保持程度的新指标。基于该指标,我们提出了两种不同的语义保持失真框架:生成式方法与替换式方法。我们在命名实体识别、成分句法分析和机器阅读理解等多项任务上的评估,证实了该失真技术在个人隐私保护中的可行性与有效性。我们还在 NLP 领域内三个以隐私为重点的任务中测试了我们的方法抵御属性攻击的能力,结果凸显了基于数据的改进方法相较于基于结构的改进方法的简洁与高效。此外,我们探索了特定医疗信息管理场景中的隐私保护,表明我们的方法能有效限制敏感数据记忆,凸显其实用性。

关键词

引用

@article{arxiv.2201.00965,
  title  = {Semantics-Preserved Distortion for Personal Privacy Protection in Information Management},
  author = {Jiajia Li and Lu Yang and Letian Peng and Shitou Zhang and Ping Wang and Zuchao Li and Hai Zhao},
  journal= {arXiv preprint arXiv:2201.00965},
  year   = {2024}
}