中文

面向嵌入即服务大语言模型的水印技术

计算与语言 2025-12-04 v1 密码学与安全 机器学习

摘要

大型语言模型(LLMs)在自然语言理解和生成方面展示了卓越能力。基于这些LLM,企业已开始提供嵌入即服务(EaaS),以文本嵌入的形式提供特征提取能力,使下游自然语言处理任务受益。然而,先前的研究已证明EaaS容易受到模仿攻击,攻击者以黑箱方式克隆服务模型而无法访问模型内部运作。作为回应,水印已被添加到文本嵌入中,以保护EaaS提供商的知识产权,使其能够检查模型所有权。本论文聚焦于通过调查EaaS水印来防御模仿攻击。为实现这一目标,我们揭示了新型攻击,并提出和验证了新的水印技术。首先,我们证明现有的EaaS水印可以通过在模仿攻击期间克隆模型时对输入文本进行释义来移除。我们的研究表明,释义可以有效地绕过当前最先进的EaaS水印,在各种攻击设置(包括不同的释义技术和模型)和数据集中的大多数情况下。这展示了近期EaaS水印技术中的一个新漏洞。随后,作为对策,我们提出了一种新的水印技术WET(Watermarking EaaS with Linear Transformation),它采用嵌入的线性变换。水印验证通过应用逆变换并比较恢复嵌入与原始嵌入之间的相似性来进行。我们证明了其对释义攻击的鲁棒性以及近乎完美的可验证性。我们进行了详细的消融研究以评估WET中每个组件和超参数的重要性。

关键词

引用

@article{arxiv.2512.03079,
  title  = {Watermarks for Embeddings-as-a-Service Large Language Models},
  author = {Anudeex Shetty},
  journal= {arXiv preprint arXiv:2512.03079},
  year   = {2025}
}