中文

StyleRemix:通过蒸馏与扰动实现可解释的作者身份混淆

计算与语言 2024-08-29 v1

摘要

作者身份混淆(authorship obfuscation)即通过改写文本有意模糊作者身份,这是一项重要但具有挑战性的任务。当前使用大型语言模型(LLM)的方法缺乏可解释性和可控性,常忽视作者特定的风格特征,导致整体性能较差。为此,我们发展了 StyleRemix,这是一种自适应且可解释的混淆方法,通过扰动原始输入文本中特定的细粒度风格元素来实现目标。StyleRemix 使用预训练的低秩适应(LoRA)模块,沿着各种风格轴(例如正式程度和长度)专门重写输入文本,同时保持低计算成本。StyleRemix 在多种领域中均优于最先进的基线方法和更大的语言模型,无论是自动评估还是人类评估都表现出色。此外,我们发布了 AuthorMix 数据集,这是一个包含 30,000 条高质量长文本的数据集,涵盖 14 位作者和 4 个领域;以及 DiSC 数据集,这是一个包含 1,500 条文本、涵盖七个风格轴和 16 个独特方向的平行语料库。

关键词

引用

@article{arxiv.2408.15666,
  title  = {StyleRemix: Interpretable Authorship Obfuscation via Distillation and Perturbation of Style Elements},
  author = {Jillian Fisher and Skyler Hallinan and Ximing Lu and Mitchell Gordon and Zaid Harchaoui and Yejin Choi},
  journal= {arXiv preprint arXiv:2408.15666},
  year   = {2024}
}