中文

PromptCOS:面向 LLM 的纯内容系统提示词版权审计

密码学与安全 2026-05-25 v3

摘要

系统提示词对于塑造基于大语言模型(LLM)应用的行为和输出质量至关重要,这促使人们在超越传统手工设计的基础上,对优化高质量提示词投入大量资源。然而,随着系统提示词成为有价值的知识产权,它们越来越容易遭受提示词窃取和未经授权的使用,凸显了对有效版权审计(尤其是水印技术)的迫切需求。现有方法依赖于验证由查询触发的细微 logit 分布偏移。我们观察到,这种依赖 logit 的验证框架在现实的纯内容场景中并不实用,主要原因在于:(1)随机采样使得内容级生成对于验证而言不稳定;(2)内容级信号所需的更强指令会损害提示词保真度。为克服这些挑战,我们提出了 PromptCOS,这是首个基于内容级输出相似度的纯内容系统提示词版权审计方法。PromptCOS 通过将循环输出信号设计为条件指令的目标来实现水印稳定性。它通过注入一小部分辅助词元来编码水印,同时保持主提示词不变,从而保持提示词保真度。此外,为确保对恶意移除的鲁棒性,我们优化了掩护词元,即原始提示词中的关键词元,以确保移除辅助词元会导致严重的性能下降。实验结果表明,promptCOS 实现了高有效性(99.3% 的平均水印相似度)、强区分度(比最佳基线高 60.8%)、高保真度(准确率下降不超过 0.6%)、鲁棒性(抵御四类潜在攻击的韧性)以及高计算效率(节省高达 98.1% 的成本)。

关键词

引用

@article{arxiv.2509.03117,
  title  = {PromptCOS: Towards Content-only System Prompt Copyright Auditing for LLMs},
  author = {Yuchen Yang and Yiming Li and Hongwei Yao and Enhao Huang and Shuo Shao and Yuyi Wang and Zhibo Wang and Dacheng Tao and Zhan Qin},
  journal= {arXiv preprint arXiv:2509.03117},
  year   = {2026}
}

备注

This paper is accepted by IEEE S&P 2026