多前缀记忆:面向大型语言模型训练数据泄露的稳健检测框架
计算与语言
2025-11-27 v1 人工智能
密码学与安全
机器学习
摘要
大型语言模型在大规模语料库上训练,容易逐字记忆训练数据,造成显著的隐私和版权风险。虽然先前工作提出了各种记忆定义,但许多定义在全面捕捉这一现象方面存在不足,尤其是针对对齐模型。为此,我们引入一种新框架:多前缀记忆。我们的核心洞见是,记忆序列被深层编码,因此可以通过显著多样化的前缀检索到。我们通过定义:若外部对抗搜索可识别出目标数量的distinct前缀以召唤该序列,则将其视为记忆序列。这一框架将关注点从单路径提取转向量化记忆的稳健性,即其检索路径的多样性。通过在开源和对齐聊天模型上的实验,我们展示了我们的多前缀定义可可靠地区分记忆与非记忆数据,为审计大型语言模型中的数据泄露提供了稳健且实用的工具。
引用
@article{arxiv.2511.20799,
title = {Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models},
author = {Trung Cuong Dang and David Mohaisen},
journal= {arXiv preprint arXiv:2511.20799},
year = {2025}
}
备注
11 pages, 2 tables, 8 figures