UPTON:通过数据投毒防止公开文本发布中的作者身份泄露
计算机与社会
2023-10-26 v3 密码学与安全
摘要
考虑这样一个场景:一位作者——例如活动家、举报人,拥有大量公开作品——希望在攻击者可能已经基于包括该作者在内的公开作品构建了作者身份归属(AA)模型的情况下“匿名”写作。为实现其愿望,我们提出一个问题:“能否使公开发布的作品 T 不可归属,从而基于 T 训练的 AA 模型无法很好地归属其作者身份?”针对该问题,我们提出了一种新颖的解决方案 UPTON,它利用黑盒数据投毒方法削弱训练样本中的作者身份特征,并使发布的文本不可学习。它与先前的混淆工作不同——例如修改测试样本的对抗攻击,或仅在触发词出现时改变模型输出的后门工作。使用四个作者身份数据集(IMDb10、IMDb64、Enron 和 WJO),我们给出了实证验证:UPTON 成功将 AA 模型的准确率降至不实用水平(约 35%),同时保持文本仍可读(语义相似度 > 0.9)。UPTON 对已经基于作者可用的干净作品训练好的 AA 模型依然有效。
引用
@article{arxiv.2211.09717,
title = {UPTON: Preventing Authorship Leakage from Public Text Release via Data Poisoning},
author = {Ziyao Wang and Thai Le and Dongwon Lee},
journal= {arXiv preprint arXiv:2211.09717},
year = {2023}
}