中文

评估水印机器生成文本在对抗性攻击下的表现

密码学与安全 2024-12-02 v2 人工智能 计算与语言 机器学习

摘要

大型语言模型 (LLM) 在文本生成和复杂任务中表现出色,但其滥用引发了关于其生成内容真实性和伦理影响的关注,如深度伪造新闻、学术欺诈和版权侵权。水印技术通过在机器生成文本中嵌入可识别标记来解决这些问题,允许内容验证和来源追溯。然而,当前 LLM 水印方案在潜在水印消除攻击下的鲁棒性尚未得到全面探讨。本文首先系统梳理了主流水印方案和机器生成文本的消除攻击方法,然后将其分为生成前水印 (pre-text) 和生成后水印 (post-text) 两类,以便开展多样化分析。在实验中,我们评估了八种水印 (五种 pre-text, 三种 post-text) 和十二种攻击 (两种 pre-text, 十种 post-text),涵盖 87 个情景。评估结果表明:(1) KGW 和指数水印在文本质量和水印保留方面表现良好,但对大多数攻击仍然脆弱;(2) post-text 攻击比 pre-text 攻击更有效且更实用;(3) pre-text 水印通常更隐蔽,因为不会改变文本流畅度,而 post-text 水印则会产生这种情况;(4) 此外,组合攻击方法可显著提高效果,凸显需要更鲁健水印方案的必要性。本研究凸显了当前技术的脆弱性,以及开发更具韧性方案的必要性。

关键词

引用

@article{arxiv.2407.04794,
  title  = {On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks},
  author = {Zesen Liu and Tianshuo Cong and Xinlei He and Qi Li},
  journal= {arXiv preprint arXiv:2407.04794},
  year   = {2024}
}