STAMp Your Content:通过水印化改写证明数据集成员身份
机器学习
2025-06-10 v2 计算与语言
密码学与安全
摘要
鉴于大量公开文本被爬取以用于预训练大型语言模型(LLM),数据创建者日益担忧其专有数据被无需归属或授权的情况下用于模型训练。此类担忧也被基准数据集策划者所分享,其测试集可能遭到破坏。本文提出STAMp框架,用于检测数据集成员身份——即确定数据集是否包含在大型语言模型的预训练语料中。给定原始内容,本方案首先生成多个改写版本,每个改写版本嵌入带有唯一密钥的水印。将发布一个版本供公众使用,其他版本保密。随后,创建者可通过比较公开版本与保密版本之间的模型概率来进行配对统计检验,以证明数据集成员身份。我们展示了STAMp框架能够成功检测四个仅在训练数据中出现一次且构成总token数小于0.001%的基准。我们验证STAMp既保留原始数据的语义含义,又保持其实用性。我们将STAMp应用于两个实际场景,以确认论文摘要和博客文章被包含在预训练语料中。
引用
@article{arxiv.2504.13416,
title = {STAMP Your Content: Proving Dataset Membership via Watermarked Rephrasings},
author = {Saksham Rastogi and Pratyush Maini and Danish Pruthi},
journal= {arXiv preprint arXiv:2504.13416},
year = {2025}
}
备注
Published at ICML 25, Code is available at https://github.com/codeboy5/stamp