ALISON:快速有效的风格计量作者身份混淆
计算与语言
2024-02-02 v1 人工智能
机器学习
摘要
作者身份归属 (Authorship Attribution, AA) 与作者身份混淆 (Authorship Obfuscation, AO) 是隐私研究中日益重要的两项竞争任务。现代 AA 利用作者一致的写作风格,通过 AA 分类器将文本与其作者匹配。AO 是相应的对抗性任务,旨在修改文本以保留其语义,同时使 AA 模型无法正确推断其作者身份。为解决最先进 (SOTA) AA 方法引发的隐私担忧,已提出新的 AO 方法,但因其训练和混淆速度极慢(通常耗时数小时)而 largely 不具实用性。针对这一挑战,我们提出了一种实用的 AO 方法 ALISON,该方法:(1) 大幅减少训练/混淆时间, демонстрируя比 SOTA AO 方法快 10 倍以上的混淆速度;(2) 通过在两个基准数据集上攻击三种基于 Transformer 的 AA 方法,实现了更好的混淆成功率,通常比竞争方法表现好 15%;(3) 在混淆过程中不需要来自目标 AA 分类器的直接信号;(4) 利用独特的风格计量特征,允许对可解释的混淆进行合理的模型解释。我们还证明,ALISON 能有效阻止四种 SOTA AA 方法准确判定 ChatGPT 生成文本的作者身份,同时最小程度地改变原始文本语义。为确保研究结果的可复现性,我们的代码和数据可在以下地址获取:https://github.com/EricX003/ALISON。
引用
@article{arxiv.2402.00835,
title = {ALISON: Fast and Effective Stylometric Authorship Obfuscation},
author = {Eric Xing and Saranya Venkatraman and Thai Le and Dongwon Lee},
journal= {arXiv preprint arXiv:2402.00835},
year = {2024}
}
备注
10 pages, 6 figures, 4 tables. To be published in the Proceedings of the 38th Annual AAAI Conference on Artificial Intelligence (AAAI-24)