面向开源 LLM 的水印技术
密码学与安全
2025-02-18 v1 机器学习
摘要
尽管开源 LLM 的水印技术尚未成熟,而封闭式 LLM 的水印技术已在大规模部署中得到成熟并被采纳,但这些方法不适用于开源模型,因为开源模型允许用户对解码过程拥有完全控制权。尽管如此,这一设置仍然受到不足的关注,尽管开源模型的性能正在不断提升。本文为开源 LLM 水印技术的系统性研究奠定了基础。首次,我们明确形式化了关键要求,包括对常见模型修改(如模型合并、量化或微调)的耐久性,并提出了具体的评估设置。鉴于这些修改在普遍存在,水印的耐久性对于开源水印的有效性至关重要。我们对现有方法进行了调查和评估,发现它们不够耐久。我们还讨论了提高其耐久性的潜在方法,并指出了剩余挑战。我们希望本工作为未来的进步提供动力,以解决这一重要问题。
引用
@article{arxiv.2502.10525,
title = {Towards Watermarking of Open-Source LLMs},
author = {Thibaud Gloaguen and Nikola Jovanović and Robin Staab and Martin Vechev},
journal= {arXiv preprint arXiv:2502.10525},
year = {2025}
}