一个女孩有名字:检测作者身份混淆
计算与语言
2020-05-05 v1 信息检索
机器学习
摘要
作者身份归属旨在基于文体计量分析识别文本的作者。相反,作者身份混淆旨在通过对文本风格进行修改来防范作者身份归属。本文中,我们在对抗威胁模型下评估最先进作者身份混淆方法的隐蔽性。混淆器的隐蔽程度取决于 adversary 是否难以检测由混淆器修改的文本是否经过混淆——这一决策对关注作者身份归属的 adversary 至关重要。我们表明现有作者身份混淆方法并不隐蔽,因为其混淆文本可被以平均 F1 分数 0.87 识别。缺乏隐蔽性的原因是这些混淆器以可检测的方式降低了文本流畅度,这一点由神经语言模型确定。我们的结果凸显了开发更隐蔽的作者身份混淆方法以更好保护寻求匿名者身份的需求。
引用
@article{arxiv.2005.00702,
title = {A Girl Has A Name: Detecting Authorship Obfuscation},
author = {Asad Mahmood and Zubair Shafiq and Padmini Srinivasan},
journal= {arXiv preprint arXiv:2005.00702},
year = {2020}
}
备注
9 pages, 4 figures, 2 tables, ACL 2020