真实场景下的对抗性文体学:针对作者画像的可迁移词汇替换攻击
计算与语言
2021-01-28 v1 计算机与社会
摘要
书面语言包含风格线索,可被利用来自动推断各种潜在的敏感作者信息。对抗性文体学旨在通过重写作者文本来攻击此类模型。我们的研究提出了若干组件,以促进这些对抗攻击在真实场景中的部署,即无法获取数据也无法访问目标模型的情况。我们引入了基于 transformer 的词汇替换攻击扩展,并表明其在弱标注语料上训练时实现了高可迁移性——将目标模型性能降至随机水平以下。尽管并非完全难以察觉,我们较成功的攻击也被证明对人类明显更不易检测。因此,我们的框架为未来隐私保护的对抗攻击提供了一个有前景的方向。
引用
@article{arxiv.2101.11310,
title = {Adversarial Stylometry in the Wild: Transferable Lexical Substitution Attacks on Author Profiling},
author = {Chris Emmery and Ákos Kádár and Grzegorz Chrupała},
journal= {arXiv preprint arXiv:2101.11310},
year = {2021}
}
备注
Accepted to EACL 2021