WatME:基于词汇冗余的无损水印方法
计算与语言
2024-06-07 v3
摘要
文本水印已成为识别机器生成文本的关键技术。然而,现有方法在解码过程中常依赖任意的词汇划分来嵌入水印,这损害了合适 token 的可用性并显著降低了回复质量。本研究从认知科学视角评估了水印对大语言模型(LLMs)不同能力的影响。我们的发现凸显了显著差异:知识回忆与逻辑推理受到的不利影响甚于语言生成。这些结果表明水印对 LLMs 的影响比此前所理解的更为深远。为应对这些挑战,我们提出互斥水印(WatME),一种利用 LLM 词表中固有词汇冗余的语言学先验知识来无缝集成水印的新方法。具体而言,WatME 通过对已识别的词汇冗余施加互斥规则,在解码过程中动态优化 token 使用。该策略有效避免了合适 token 不可用的情况,并保留了 LLMs 的表达能力。我们提供了理论分析与经验证据,表明 WatME 在确保水印可检测性的同时,有效保留了 LLMs 的多种能力。
引用
@article{arxiv.2311.09832,
title = {WatME: Towards Lossless Watermarking Through Lexical Redundancy},
author = {Liang Chen and Yatao Bian and Yang Deng and Deng Cai and Shuaiyi Li and Peilin Zhao and Kam-fai Wong},
journal= {arXiv preprint arXiv:2311.09832},
year = {2024}
}
备注
Accepted to ACL 2024 main conference