中文

SLIM:基于隐空间混淆区的低覆盖性黑盒水印

密码学与安全 2026-04-30 v2

摘要

训练数据是大语言模型(LLM)开发中的关键且常为专有资产,动机使用数据水印以嵌入可传输的信号进行用途验证。我们识别出低覆盖性是实用性的关键且被大体忽视的要求,因为单个数据所有者通常仅贡献巨型训练语料库的极小部分。先前方法在仅能修改一个或几个序列时难以维持隐秘性、验证可行性或鲁棒性。为此,我们引入SLIM,一个在严格黑盒访问下实现单用户数据源 provenance 验证的框架。SLIM利用内在LLM特性,通过训练模型将语义相似的前缀映射到不同的延续来诱导隐空间混淆区。这表现为局部生成不稳定性,可通过假设检验可靠检测。实验表明,SLIM实现了超低覆盖能力、强大的黑盒验证性能和卓越的可扩展性,同时保持隐秘性和模型实用性,为保护现代LLM管道中的训练数据提供了稳健解决方案。

关键词

引用

@article{arxiv.2601.03242,
  title  = {SLIM: Stealthy Low-Coverage Black-Box Watermarking via Latent-Space Confusion Zones},
  author = {Hengyu Wu and Yang Cao},
  journal= {arXiv preprint arXiv:2601.03242},
  year   = {2026}
}

备注

Accept the findings of ACL 2026