通过词重要性评分提升带水印大型语言模型的生成质量
计算与语言
2023-11-17 v1 密码学与安全
机器学习
摘要
大型语言模型(LLM)强大的通用能力若被恶意用户无限制地获取,会带来潜在的伦理风险。词级水印通过以前缀词为种子、由私有随机数生成器改变词元概率分布,从而在生成文本中插入水印。然而,该水印算法在生成过程中改变了 logits,若其选择提升与输入相关性较低的词元,会导致文本质量下降。在本工作中,我们提出通过带重要性评分的水印(WIS)来改善带水印语言模型生成文本的质量。在每一步生成中,我们估计待生成词元的重要性,若其对输出的语义正确性重要,则防止其受水印影响。我们进一步提出三种预测重要性评分的方法,包括一种基于扰动的方法和两种基于模型的方法。实证实验表明,我们的方法能在可比较的检测率水平下生成质量更好的文本。
引用
@article{arxiv.2311.09668,
title = {Improving the Generation Quality of Watermarked Large Language Models via Word Importance Scoring},
author = {Yuhang Li and Yihan Wang and Zhouxing Shi and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2311.09668},
year = {2023}
}
备注
Work in progress