基于拼贴式成员推断的黑盒模型来源追溯
机器学习
2025-10-23 v1 计算与语言
摘要
假设 Alice 训练一个开放权重语言模型,Bob 使用 Alice 模型的黑盒衍生模型生成文本。Alice 能否通过查询 Bob 的衍生模型(查询设置)或仅凭文本(观察设置)证明 Bob 正在使用她的模型?我们将此问题形式化为独立性检验问题——原假设是 Bob 的模型或文本与 Alice 的随机化训练运行独立——并通过拼贴式记忆(palimpsestic memorization)来检视:语言模型更倾向于记忆在训练中后期看到的数据,因此我们可以使用捕获 Bob 的模型或文本与 Alice 训练运行中训练示例排序相关性的检验统计量来测试 Bob 是否在使用 Alice 的模型。如果 Alice 随机混排了训练数据,则任何显著相关性恰好对应于对原假设的可量化统计证据,无论 Alice 的训练数据的组成如何。在查询设置下,我们直接估计(通过提示)Bob 的模型对 Alice 的训练示例和顺序的可能性;我们将各种 Pythia 和 OLMo 基础模型从 1B 到 12B 参数的 40 多个 fine-tune 版本的可能性与基础模型的训练数据顺序相关联,在除六个例外外的所有情况下实现约为 1e-8 的 p 值。在观察设置下,我们尝试两种基于估计 1)Bob 的文本与 Alice 训练示例片段重叠的可能性以及 2)Bob 的文本相对于 Alice 通过在重新混排数据上重复进行训练运行最后阶段(例如 1%)获得的不同模型版本的可能性的方法。第二种方法能够可靠地区分 Bob 的文本即使仅来自几百个标记;第一种方法无需重新训练,但需要更多令牌(数十万)才能实现高检出功效。
引用
@article{arxiv.2510.19796,
title = {Blackbox Model Provenance via Palimpsestic Membership Inference},
author = {Rohith Kuditipudi and Jing Huang and Sally Zhu and Diyi Yang and Christopher Potts and Percy Liang},
journal= {arXiv preprint arXiv:2510.19796},
year = {2025}
}