去标识化文本变换的隐私保证
计算与语言
2022-11-16 v2
摘要
面向自然语言处理任务的机器学习方法受益于对真实用户数据的全面收集。同时,显然需要保护被收集和处理数据的用户隐私。对于文本集合,例如语音交互转录文本或病历,将敏感部分替换为良性替代物可实现去标识化。然而,此类文本变换实际提供多少隐私保证,且所得文本是否仍对机器学习有用?本文基于差分隐私推导了通用基于文本变换的去标识化方法的形式化隐私保证。我们还度量了对话转录文本中不同遮蔽隐私信息的方式对后续机器学习任务的影响。为此,我们制定了不同的遮蔽策略并比较其隐私-效用权衡。特别地,我们将简单的删除方法与使用深度学习模型在多个自然语言理解任务(如命名实体识别、意图检测和对话行为分类)上进行的更精细的逐词替换进行比较。我们发现只有逐词替换能抵御各种任务中的性能下降。
引用
@article{arxiv.2008.03101,
title = {Privacy Guarantees for De-identifying Text Transformations},
author = {David Ifeoluwa Adelani and Ali Davody and Thomas Kleinbauer and Dietrich Klakow},
journal= {arXiv preprint arXiv:2008.03101},
year = {2022}
}
备注
Proceedings of INTERSPEECH 2020 (Added link to code/data)