一种面向大语言模型、抗改写的鲁棒语义水印
密码学与安全
2024-04-02 v2
摘要
大语言模型(LLMs)已在多种自然语言任务中展现出强大能力。然而,人们担忧 LLMs 可能被不当甚至非法使用。为防止 LLMs 的恶意使用,在 LLM 应用部署中检测 LLM 生成的文本变得至关重要。水印是一种有效策略,通过编码预定义的秘密水印来检测 LLM 生成的内容,从而便利检测过程。然而,现有多数水印方法利用前序 token 的简单哈希来划分词表。此类水印易被改写消除,相应地检测效果将大打折扣。因此,为增强抗改写的鲁棒性,我们提出一种基于语义的水印框架 SemaMark。它利用语义替代 token 的简单哈希,因为改写很可能保留句子的语义含义。我们进行了全面的实验,以证明 SemaMark 在不同改写下的有效性与鲁棒性。
引用
@article{arxiv.2311.08721,
title = {A Robust Semantics-based Watermark for Large Language Model against Paraphrasing},
author = {Jie Ren and Han Xu and Yiding Liu and Yingqian Cui and Shuaiqiang Wang and Dawei Yin and Jiliang Tang},
journal= {arXiv preprint arXiv:2311.08721},
year = {2024}
}
备注
Accepted to NAACL findings 2024