铭记吾言:语言模型水印的分析与评估
密码学与安全
2024-10-15 v3 人工智能
计算与语言
摘要
近年来大语言模型的能力显著增强,对其滥用的担忧也随之增加。能够区分机器生成文本与人类创作内容十分重要。先前的研究提出了众多文本水印方案,这些方案将受益于一个系统性的评估框架。本工作聚焦于LLM输出水印技术——而非图像或模型水印——并提出了Mark My Words,一个在不同自然语言任务下针对这些技术的综合基准。我们关注三个主要指标:质量、大小(即检测水印所需的token数量)以及抗篡改能力(即在扰动带水印文本后检测水印的能力)。当前的水印技术已几乎达到实际可用的程度:Kirchenbauer等人[33]的方案可以为Llama 2 7B-chat或Mistral-7B-Instruct等模型添加水印,且在自然语言任务上质量无可见损失,该水印可用少于100个token检测出来,并且其方案对简单扰动具有良好的抗篡改能力。然而,它们在为代码生成高效添加水印方面存在困难。我们公开发布了我们的基准(https://github.com/wagner-group/MarkMyWords)。
引用
@article{arxiv.2312.00273,
title = {Mark My Words: Analyzing and Evaluating Language Model Watermarks},
author = {Julien Piet and Chawin Sitawarin and Vivian Fang and Norman Mu and David Wagner},
journal= {arXiv preprint arXiv:2312.00273},
year = {2024}
}
备注
22 pages, 18 figures