中文

Bileve:利用双层签名保护大语言模型文本来源免受欺骗攻击

密码学与安全 2024-10-30 v3 计算与语言

摘要

大语言模型(LLM)的文本水印通常用于识别机器生成内容的来源,这在打击深度伪造或有害内容时对于责任评估具有广阔前景。尽管现有的水印技术通常优先考虑抵御移除攻击的鲁棒性,但遗憾的是,它们容易受到欺骗攻击:恶意行为者可以微妙地改变LLM生成回复的含义,甚至伪造有害内容,从而可能将责任错误地归咎于LLM开发者。为克服这一问题,我们引入了一种双层签名方案Bileve,它通过一种新颖的基于秩的采样策略,嵌入用于完整性检查的细粒度签名比特(以缓解欺骗攻击),以及在签名无效时用于追踪文本来源的粗粒度信号(以增强可检测性)。与仅输出二元结果的传统水印检测器相比,Bileve能够在检测过程中区分5种场景,可靠地追踪文本来源并规范LLM。在OPT-1.3B和LLaMA-7B上进行的实验证明了Bileve在击败欺骗攻击并增强可检测性方面的有效性。代码可在 https://github.com/Tongzhou0101/Bileve-official 获取。

关键词

引用

@article{arxiv.2406.01946,
  title  = {Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature},
  author = {Tong Zhou and Xuandong Zhao and Xiaolin Xu and Shaolei Ren},
  journal= {arXiv preprint arXiv:2406.01946},
  year   = {2024}
}

备注

NeurIPS 2024 camera-ready