新评估指标捕捉 LLM 水印导致的质量退化
计算与语言
2023-12-06 v1
摘要
随着 ChatGPT 等大型语言模型(LLM)的日益广泛使用,水印已成为追踪机器生成内容的一种有前景的方法。然而,关于 LLM 水印的研究通常依赖于简单的困惑度或基于多样性的度量来评估带水印文本的质量,这可能会掩盖水印的重要局限性。在此,我们引入了两种新的、易于使用的方法来评估 LLM 的水印算法:1)由具有特定准则的 LLM 评判器进行评估;2)对文本嵌入进行二元分类,以区分带水印和不带水印的文本。我们应用这些方法来表征当前水印技术的有效性。我们在各种数据集上进行的实验表明,当前的水印方法甚至可以被简单的分类器检测到,这挑战了水印隐蔽性的概念。我们还通过 LLM 评判器发现,水印会影响文本质量,特别是会降低响应的连贯性和深度。我们的研究结果强调了水印鲁棒性与文本质量之间的权衡,并突显了拥有更具信息量的指标来评估水印质量的重要性。
引用
@article{arxiv.2312.02382,
title = {New Evaluation Metrics Capture Quality Degradation due to LLM Watermarking},
author = {Karanpartap Singh and James Zou},
journal= {arXiv preprint arXiv:2312.02382},
year = {2023}
}