中文

Ward:基于 LLM 水印的可证明 RAG 数据集推断

机器学习 2025-02-26 v2 人工智能 密码学与安全

摘要

RAG 使 LLM 能够轻松整合外部数据,引发了数据所有者对内容未经授权使用之顾虑。检测此类未经授权使用的挑战尚未得到充分探讨,现有数据集和方法不适用于此领域。我们采取了若干步骤来弥合这一差距。首先,我们将此问题形式化为(黑盒)RAG 数据集推断(RAG-DI)。随后,我们引入了一个用于现实基准测试 RAG-DI 方法的数据集,同时提供了若干基线方法。最后,我们提出了 Ward,一种基于 LLM 水印的 RAG-DI 方法,为数据所有者在 RAG 语料库中检测数据集滥用提供了严格的统计保证。Ward 在所有基线方法中 consistently 优于表现,实现更高的准确率、更优的查询效率和更好的鲁棒性。我们的工作为未来 RAG-DI 研究提供了基础,同时突显了 LLM 水印作为解决此问题的有前景的方法。

关键词

引用

@article{arxiv.2410.03537,
  title  = {Ward: Provable RAG Dataset Inference via LLM Watermarks},
  author = {Nikola Jovanović and Robin Staab and Maximilian Baader and Martin Vechev},
  journal= {arXiv preprint arXiv:2410.03537},
  year   = {2025}
}

备注

ICLR 2025