CODE ACROSTIC: 稳健的代码生成水印技术
密码学与安全
2025-12-18 v1 人工智能
摘要
对大语言模型(LLM)进行水印处理对于防止其滥用至关重要,包括制造虚假信息、抄袭和垃圾信息。尤其重要的是对 LLM 生成的代码进行水印处理,因为它通常包含知识产权。然而,我们发现现有的 LLM 生成代码水印方法未能解决注释移除攻击。在这种情况下,攻击者可以简单地移除生成代码中的注释而不影响其功能,从而显著降低当前代码水印技术的有效性。另一方面,将水印注入代码具有挑战性,因为正如先前研究指出的,大多数代码相比自然语言是低熵场景。我们解决这一问题的方法是利用先验知识来区分代码中的低熵和高熵部分,这由一个提示词列表(Cue List)指示。然后我们根据该 Cue List 引导水印注入,实现了比现有方法更高的可检测性和可用性。我们在 HumanEval 上评估了所提出的方法,并将我们的方法与三种最先进的代码水印技术进行了比较。结果证明了我们方法的有效性。
引用
@article{arxiv.2512.14753,
title = {CODE ACROSTIC: Robust Watermarking for Code Generation},
author = {Li Lin and Siyuan Xin and Yang Cao and Xiaochun Cao},
journal= {arXiv preprint arXiv:2512.14753},
year = {2025}
}