WaterBench:面向大语言模型水印的整体评测
计算与语言
2024-07-02 v2 人工智能
摘要
为缓解大语言模型(LLMs)的潜在滥用,近期研究开发了水印算法,其通过限制生成过程以留下用于水印检测的不可见痕迹。由于该任务具有两阶段特性,多数研究分别评估生成与检测,从而给无偏、全面且实用的评测带来挑战。本文提出 WaterBench,首个针对 LLM 水印的综合基准,其中我们设计了三个关键因素:(1)在基准流程上,为确保公平比较,我们首先调整各水印方法的超参数以达成相同水印强度,再联合评估其生成与检测性能。(2)在任务选择上,我们使输入与输出长度多样化,形成涵盖 项任务的五类体系。(3)在评测指标上,我们采用 GPT4-Judge 自动评估水印后指令遵循能力的下降。我们在 个 LLM 上以 种水印强度评估了 种开源水印,并观察到当前方法在保持生成质量方面的普遍困境。代码与数据见 https://github.com/THU-KEG/WaterBench。
引用
@article{arxiv.2311.07138,
title = {WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models},
author = {Shangqing Tu and Yuliang Sun and Yushi Bai and Jifan Yu and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2311.07138},
year = {2024}
}
备注
26pages, 7 figures, accepted by ACL 2024