一个女孩有名字,它叫……用于去混淆的对抗性作者身份归因
计算与语言
2022-03-23 v1 密码学与安全
机器学习
摘要
自然语言处理的最新进展使得强大的侵犯隐私的作者身份归因成为可能。为对抗作者身份归因,研究者提出了多种基于规则和基于学习的文本混淆方法。然而,现有的作者身份混淆方法未考虑对抗性威胁模型。具体而言,它们未针对知晓潜在混淆的对抗性训练作者身份归因器进行评估。为填补此空白,我们研究用于去混淆的对抗性作者身份归因问题。我们表明,对抗性训练的作者身份归因器能够将现有混淆器的有效性从 20-30% 降至 5-10%。我们还评估了当归因器对是否及使用了何种混淆器做出错误假设时对抗性训练的有效性。尽管归因准确率有明显下降,但值得注意的是,该下降仍达到或高于完全未对抗性训练的归因器的归因准确率。我们的结果凸显了对抗去混淆的更强混淆方法的必要性。
引用
@article{arxiv.2203.11849,
title = {A Girl Has A Name, And It's ... Adversarial Authorship Attribution for Deobfuscation},
author = {Wanyue Zhai and Jonathan Rusert and Zubair Shafiq and Padmini Srinivasan},
journal= {arXiv preprint arXiv:2203.11849},
year = {2022}
}
备注
9 pages, 7 figures, 3 tables, ACL 2022