MCGMark: 一种用于追踪 LLM 生成的恶意代码的可编码且稳健的在线水印
密码学与安全
2025-04-22 v2 软件工程
摘要
随着大语言模型 (LLM) 的兴起,诸多软件服务提供商 (SSP)致力于开发针对代码生成任务定制的 LLM,如 CodeLlama 和 Copilot。然而,这些 LLM 可能被攻击者用于创建恶意软件,这可能对软件生态系统构成潜在威胁。例如,它们可以自动化创建高级网络钓鱼恶意软件。为此,我们首先进行经验研究,设计了一个 prompt 数据集 MCGTest,涉及约 400 人小时的工作,包含 406 个恶意代码生成任务。利用该数据集,我们提出 MCGMark,是首个稳健、代码结构感知且可编码的水印方法,用于追踪 LLM 生成的代码。我们通过控制 token 选择嵌入可编码信息,并基于概率异常值确保输出质量。此外,我们考虑恶意代码的结构特征,防止水印嵌入在易于修改的位置(如注释)中。我们在 DeepSeek-Coder 上验证了 MCGMark 的有效性和稳健性。MCGMark 在最大输出限制为 400 tokens 的情况下,嵌入成功率为 88.9%。Furthermore, it also demonstrates strong robustness and has minimal impact on the quality of the output code.我们的做法帮助 SSP 在追踪和对 LLM 生成的恶意代码负责任方面发挥作用。
引用
@article{arxiv.2408.01354,
title = {MCGMark: An Encodable and Robust Online Watermark for Tracing LLM-Generated Malicious Code},
author = {Kaiwen Ning and Jiachi Chen and Qingyuan Zhong and Tao Zhang and Yanlin Wang and Wei Li and Jingwen Zhang and Jianxing Yu and Yuming Feng and Weizhe Zhang and Zibin Zheng},
journal= {arXiv preprint arXiv:2408.01354},
year = {2025}
}