中文

对抗性水印变换器:通过数据隐藏追踪文本出处

密码学与安全 2021-03-30 v2 计算与语言 计算机与社会 机器学习

摘要

自然语言生成的最新进展引入了强大的语言模型,能够生成高质量的输出文本。然而,这引发了对这些模型可能被恶意滥用的担忧。在本文中,我们研究自然语言水印作为一种防御手段,以帮助更好地标记和追踪文本的出处。我们引入了对抗性水印变换器(AWT),它采用联合训练的编码器-解码器和对抗训练,给定输入文本和二进制消息,生成输出文本,该文本以不引人注目的方式编码了给定消息。我们进一步研究了不同的训练和推理策略,以最小化对输入文本语义和正确性的改变。AWT是第一个端到端的模型,通过自动学习(无需真实标签)单词替换及其位置来在文本中隐藏数据,从而编码消息。我们通过实验表明,我们的模型在很大程度上有助于保留文本效用和解码水印,同时在对敌手隐藏其存在方面也有效。此外,我们证明了我们的方法对一系列攻击具有鲁棒性。

关键词

引用

@article{arxiv.2009.03015,
  title  = {Adversarial Watermarking Transformer: Towards Tracing Text Provenance with Data Hiding},
  author = {Sahar Abdelnabi and Mario Fritz},
  journal= {arXiv preprint arXiv:2009.03015},
  year   = {2021}
}