TAROT:基于策略优化的面向任务的作者身份混淆
计算与语言
2025-03-19 v2
摘要
作者身份混淆旨在通过改变与文本作者相关的写作风格、词汇、句法和其他语言特征来掩饰文本中作者的身份。这种改变需要在隐私和效用之间取得平衡。强大的混淆技术虽然可以有效隐藏作者身份,但往往会降低文本对其预期目的的质量和效用。相反,保持高效用往往提供不足的隐私,使攻击者更容易对作者进行去匿名化。因此,在这两个相互冲突的目标之间实现最优权衡至关重要。在本文中,我们提出了TAROT:基于策略优化的面向任务的作者身份混淆,一种新的无监督作者身份混淆方法,其目标是通过考虑其下游效用来重写整个文本以优化隐私-效用权衡。我们的方法利用策略优化作为小语言模型的微调范式,以便在保留作者身份和下游任务效用的同时重写文本。我们表明我们的方法在大幅降低攻击者准确率的同时保持了效用。我们公开发布了我们的代码和模型。
引用
@article{arxiv.2407.21630,
title = {TAROT: Task-Oriented Authorship Obfuscation Using Policy Optimization Methods},
author = {Gabriel Loiseau and Damien Sileo and Damien Riquet and Maxime Meyer and Marc Tommasi},
journal= {arXiv preprint arXiv:2407.21630},
year = {2025}
}
备注
Accepted to the NAACL PrivateNLP 2025 Workshop