Ward:基于 LLM 水印的可证明 RAG 数据集推断
机器学习
2025-02-26 v2 人工智能
密码学与安全
摘要
RAG 使 LLM 能够轻松整合外部数据,引发了数据所有者对内容未经授权使用之顾虑。检测此类未经授权使用的挑战尚未得到充分探讨,现有数据集和方法不适用于此领域。我们采取了若干步骤来弥合这一差距。首先,我们将此问题形式化为(黑盒)RAG 数据集推断(RAG-DI)。随后,我们引入了一个用于现实基准测试 RAG-DI 方法的数据集,同时提供了若干基线方法。最后,我们提出了 Ward,一种基于 LLM 水印的 RAG-DI 方法,为数据所有者在 RAG 语料库中检测数据集滥用提供了严格的统计保证。Ward 在所有基线方法中 consistently 优于表现,实现更高的准确率、更优的查询效率和更好的鲁棒性。我们的工作为未来 RAG-DI 研究提供了基础,同时突显了 LLM 水印作为解决此问题的有前景的方法。
引用
@article{arxiv.2410.03537,
title = {Ward: Provable RAG Dataset Inference via LLM Watermarks},
author = {Nikola Jovanović and Robin Staab and Maximilian Baader and Martin Vechev},
journal= {arXiv preprint arXiv:2410.03537},
year = {2025}
}
备注
ICLR 2025