中文

WaterJudge:大语言模型水印中的质量与检测权衡

计算与语言 2024-03-29 v1

摘要

对生成式 AI 系统(如 LLM)进行水印处理已引起广泛关注,这得益于其在广泛任务中增强的能力。尽管现有方法已证明,词分布中依赖于上下文的微小偏移可用于应用和检测水印,但关于分析这些扰动对生成文本质量影响的研究仍然很少。在平衡高可检测性与最小性能退化之间,对于选择合适的水印设置至关重要;因此,本文提出了一个简单的分析框架,其中使用比较评估(一种灵活的 NLG 评估框架)来评估特定水印设置引起的质量退化。我们证明,我们的框架提供了水印设置的质量与检测权衡的简便可视化,使得寻找一个提供均衡性能的 LLM 水印工作点变得简单。该方法被应用于两个不同的摘要系统和一个翻译系统,实现了任务的跨模型分析以及跨任务分析。

关键词

引用

@article{arxiv.2403.19548,
  title  = {WaterJudge: Quality-Detection Trade-off when Watermarking Large Language Models},
  author = {Piotr Molenda and Adian Liusie and Mark J. F. Gales},
  journal= {arXiv preprint arXiv:2403.19548},
  year   = {2024}
}

备注

NAACL 2024 (Findings)