面向大型语言模型的多指定探测器水印
密码学与安全
2024-10-02 v2 人工智能
摘要
本文我们首次研究了大型语言模型(LLM)的多指定探测器水印(multi-designated detector watermarking, MDDW)。这种技术允许模型提供者生成带有水印的 LLM 输出,具有两个关键特性:(i)只有特定的、可能是多个的指定探测器可以识别水印,(ii)普通用户的输出质量几乎没有可感知的降低。我们为 MDDW 形式化了安全定义,并提出了构建 MDDW 的框架,可用于任何 LLM,方法使用多指定验证者签名(multi-designated verifier signatures, MDVS)。鉴于 LLM 输出具有显著的经济价值,我们引入了可选的安全特性 claimability,以便在指定探测器设置下使模型提供者能够主张其 LLM 输出的所有权。为了支持可声称的 MDDW,我们提出了一种通用的转换,将任何 MDVS 转换为可声称的 MDVS。我们的 MDDW 实现方案突显了其高级功能和灵活性,优于现有方法,具有令人满意的性能指标。
引用
@article{arxiv.2409.17518,
title = {Multi-Designated Detector Watermarking for Language Models},
author = {Zhengan Huang and Gongxian Zeng and Xin Mu and Yu Wang and Yue Yu},
journal= {arXiv preprint arXiv:2409.17518},
year = {2024}
}