中文

面向大语言模型的具有增强可检测性与语义连贯性的特定 Token 水印

机器学习 2024-06-07 v3 计算与语言 密码学与安全

摘要

大语言模型生成的高质量回复可能包含虚假信息,凸显了通过区分 AI 生成文本与人类撰写文本进行监管的必要性。水印技术在此背景下至关重要,它涉及在大语言模型推理阶段将隐藏标记嵌入文本中,且对人类不可感知。同时实现所嵌入水印的可检测性与生成文本的语义质量具有挑战性。虽然当前的水印算法在此方向上已取得可喜进展,但仍存在显著的改进空间。为应对这些挑战,我们引入了一种用于水印的新型多目标优化(MOO)方法,该方法利用轻量级网络生成特定 Token 的水印 logits 和分割比例。通过利用 MOO 同时优化检测和语义目标函数,我们的方法同时实现了可检测性和语义完整性。实验结果表明,我们的方法在增强大语言模型生成文本的可检测性的同时保持其语义连贯性方面,优于当前的水印技术。我们的代码可在 https://github.com/mignonjia/TS_watermark 获取。

关键词

引用

@article{arxiv.2402.18059,
  title  = {Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models},
  author = {Mingjia Huo and Sai Ashish Somayajula and Youwei Liang and Ruisi Zhang and Farinaz Koushanfar and Pengtao Xie},
  journal= {arXiv preprint arXiv:2402.18059},
  year   = {2024}
}

备注

22 pages, 13 figures, 5 tables