中文

一种面向大语言模型、抗改写的鲁棒语义水印

密码学与安全 2024-04-02 v2

摘要

大语言模型(LLMs)已在多种自然语言任务中展现出强大能力。然而,人们担忧 LLMs 可能被不当甚至非法使用。为防止 LLMs 的恶意使用,在 LLM 应用部署中检测 LLM 生成的文本变得至关重要。水印是一种有效策略,通过编码预定义的秘密水印来检测 LLM 生成的内容,从而便利检测过程。然而,现有多数水印方法利用前序 token 的简单哈希来划分词表。此类水印易被改写消除,相应地检测效果将大打折扣。因此,为增强抗改写的鲁棒性,我们提出一种基于语义的水印框架 SemaMark。它利用语义替代 token 的简单哈希,因为改写很可能保留句子的语义含义。我们进行了全面的实验,以证明 SemaMark 在不同改写下的有效性与鲁棒性。

关键词

引用

@article{arxiv.2311.08721,
  title  = {A Robust Semantics-based Watermark for Large Language Model against Paraphrasing},
  author = {Jie Ren and Han Xu and Yiding Liu and Yingqian Cui and Shuaiqiang Wang and Dawei Yin and Jiliang Tang},
  journal= {arXiv preprint arXiv:2311.08721},
  year   = {2024}
}

备注

Accepted to NAACL findings 2024