中文

DuCodeMark:基于风格感知水印-中毒设计的双目的代码数据集水印

密码学与安全 2026-04-21 v2

摘要

大型代码语言模型(CodeLM)的 proliferation 以及开源贡献加剧了对源代码数据集未授权使用的担忧。尽管水印提供了通过嵌入所有权信号来保护数据集的可行方法,但现有方法依赖可检测的触发器-目标模式,且仅限于源代码任务,忽略了诸如反编译任务等其他情景。在本文中,我们提出 DuCodeMark,一种针对代码数据集的双目的水印方法,具备隐秘性和鲁棒性,能够在源代码任务和反编译任务之间普遍适应。DuCodeMark 将每个代码样本解析为抽象语法树(AST),应用语言特定的风格转换以构建隐蔽的触发器-目标对,并注入可抑制的中毒特征于一部分返回类型样本中以增强对水印移除或规避的鲁棒性。这些特征在正常训练期间保持非激活状态,但在水印移除后被激活,降低模型性能。对于验证,DuCodeMark 采用基于独立样本 t 检验的黑盒方法。我们在涵盖两个代码任务、两个编程语言、三个 CodeLM 和六种解码温度的 72 种设置上进行了全面评估。结果表明,它始终实现强大的可验证性(p < 0.05)、高隐蔽性(怀疑率 <= 0.36)、对水印和中毒攻击的鲁棒性(召回率 <= 0.57),以及在水印移除后模型性能显著下降(Pass@1 下降 28.6%),凸显了其实用性和抗性。

关键词

引用

@article{arxiv.2604.10611,
  title  = {DuCodeMark: Dual-Purpose Code Dataset Watermarking via Style-Aware Watermark-Poison Design},
  author = {Yuchen Chen and Yuan Xiao and Chunrong Fang and Zhenyu Chen and Baowen Xu},
  journal= {arXiv preprint arXiv:2604.10611},
  year   = {2026}
}

备注

Accepted to the 34rd ACM International Conference on the Foundations of Software Engineering (FSE 2026)