中文

通过词重要性评分提升带水印大型语言模型的生成质量

计算与语言 2023-11-17 v1 密码学与安全 机器学习

摘要

大型语言模型(LLM)强大的通用能力若被恶意用户无限制地获取,会带来潜在的伦理风险。词级水印通过以前缀词为种子、由私有随机数生成器改变词元概率分布,从而在生成文本中插入水印。然而,该水印算法在生成过程中改变了 logits,若其选择提升与输入相关性较低的词元,会导致文本质量下降。在本工作中,我们提出通过带重要性评分的水印(WIS)来改善带水印语言模型生成文本的质量。在每一步生成中,我们估计待生成词元的重要性,若其对输出的语义正确性重要,则防止其受水印影响。我们进一步提出三种预测重要性评分的方法,包括一种基于扰动的方法和两种基于模型的方法。实证实验表明,我们的方法能在可比较的检测率水平下生成质量更好的文本。

关键词

引用

@article{arxiv.2311.09668,
  title  = {Improving the Generation Quality of Watermarked Large Language Models via Word Importance Scoring},
  author = {Yuhang Li and Yihan Wang and Zhouxing Shi and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:2311.09668},
  year   = {2023}
}

备注

Work in progress