中文

生成带水印的对抗性文本

密码学与安全 2023-03-06 v1 计算与语言

摘要

对抗样本生成近年来成为热点,因为它能使深度神经网络(DNNs)对生成的对抗样本产生误分类,这揭示了 DNNs 的脆弱性,促使我们寻找良好方案以提升 DNN 模型的鲁棒性。由于自然语言在社交网络上的广泛性与高流动性,文献中已提出多种基于自然语言的对抗攻击算法。这些算法生成具有高语义质量的对抗文本样本。然而,生成的对抗文本样本可能被恶意或非法使用。为解决此问题,我们提出一个生成带水印对抗文本样本的通用框架。对于给定文本中的每个词,确定一组候选词,以确保该集合中的所有词既可用于携带秘密比特,也可用于辅助构建对抗样本。通过应用词级对抗文本生成算法,最终可生成带水印的对抗文本样本。实验表明,所提方法生成的对抗文本样本不仅成功欺骗了先进的 DNN 模型,还携带了可有效验证所有权并追溯对抗样本来源的水印。此外,该水印在遭受对抗样本生成算法攻击后仍能存活,展现了适用性与优越性。

关键词

引用

@article{arxiv.2110.12948,
  title  = {Generating Watermarked Adversarial Texts},
  author = {Mingjie Li and Hanzhou Wu and Xinpeng Zhang},
  journal= {arXiv preprint arXiv:2110.12948},
  year   = {2023}
}

备注

https://scholar.google.com/citations?user=IdiF7M0AAAAJ&hl=en