大语言模型的必要且充分水印
计算与语言
2025-02-18 v2 机器学习
摘要
近年来,大语言模型(LLMs)在各种NLP任务中取得了卓越表现。它们能生成与人工书写文本难以区分的文字。LLMs如此卓越的性能增加了其被用于恶意目的(如生成假新闻文章)的风险。因此,有必要开发区分LLM生成文本与人工书写文本的方法。水印是实现此目的最有力方法之一。尽管现有水印方法已成功检测LLM生成文本,但它们显著降低了生成文本的质量。本研究提出必要且充分水印(NS-Watermark),可在不降低文本质量的前提下向生成文本中嵌入水印。更具体地,我们推导出为区分文本由LLM还是人类书写而须施加于生成文本上的最小约束。继而将NS-Watermark表述为约束优化问题,并提出一种高效求解算法。通过实验,我们证明NS-Watermark能比现有水印方法生成更自然的文本,并更准确区分LLM与人工书写文本。尤其在机器翻译任务中,NS-Watermark可超越现有水印方法至多30个BLEU分数。
引用
@article{arxiv.2310.00833,
title = {Necessary and Sufficient Watermark for Large Language Models},
author = {Yuki Takezawa and Ryoma Sato and Han Bao and Kenta Niwa and Makoto Yamada},
journal= {arXiv preprint arXiv:2310.00833},
year = {2025}
}
备注
TMLR 2025