关于成员推断用于版权审计的证据局限性
密码学与安全
2026-01-21 v1 人工智能
摘要
随着大语言模型(LLM)在日益不透明的语料库上进行训练,成员推断攻击(MIA)被提出用于审计训练期间是否使用了受版权保护的文本,尽管人们对其在现实条件下的可靠性日益担忧。我们探讨 MIA 是否能在对抗性版权纠纷中作为可采信证据,在此类纠纷中被指控的模型开发者可能会在保留语义内容的同时对训练数据进行混淆,并通过法官-起诉人-被指控者通信协议将此场景形式化。为了测试该协议下的鲁棒性,我们引入了 SAGE(结构感知 SAE 引导提取),这是一个由稀疏自编码器(SAE)引导的释义框架,该框架重写训练数据以改变词汇结构,同时保留语义内容和下游效用。我们的实验表明,当模型在 SAGE 生成的释义上进行微调时,SOTA MIA 的性能会下降,这表明其信号对保留语义的转换不具鲁棒性。虽然在某些微调机制下仍存在一些泄漏,但这些结果表明,MIA 在对抗性环境中是脆弱的,作为 LLM 版权审计的独立机制本身是不充分的。
引用
@article{arxiv.2601.12937,
title = {On the Evidentiary Limits of Membership Inference for Copyright Auditing},
author = {Murat Bilgehan Ertan and Emirhan Böge and Min Chen and Kaleel Mahmood and Marten van Dijk},
journal= {arXiv preprint arXiv:2601.12937},
year = {2026}
}