中文

DyePack:利用后门可证明地标记 LLM 中的测试集污染

计算与语言 2025-09-25 v5

摘要

开放基准测试对于评估和推进大语言模型至关重要,提供了可复现性和透明度。然而,其可访问性使其可能成为测试集污染的目标。在本工作中,我们引入了 DyePack,这是一个利用后门攻击来识别在训练期间使用了基准测试集的模型的框架,而无需访问模型的损失、logits 或任何内部细节。就像银行将染色包混入其钞票中以标记劫匪一样,DyePack 将后门样本与测试数据混合,以标记在其上训练过的模型。我们提出了一种结合多个具有随机目标的后门的原则性设计,能够在标记每个模型时精确计算假阳性率(FPR)。这在可证明地防止错误指控的同时,为每个检测到的污染案例提供了强有力的证据。我们在三个数据集上对五个模型评估了 DyePack,涵盖了多项选择和开放式生成任务。对于多项选择题,它成功检测了所有受污染模型,在使用八个后门的情况下,MMLU-Pro 上的保证 FPR 低至 0.000073%,Big-Bench-Hard 上为 0.000017%。对于开放式生成任务,它具有良好的泛化能力,在使用六个后门的情况下,以仅 0.127% 的保证假阳性率识别了 Alpaca 上的所有受污染模型。

关键词

引用

@article{arxiv.2505.23001,
  title  = {DyePack: Provably Flagging Test Set Contamination in LLMs Using Backdoors},
  author = {Yize Cheng and Wenxiao Wang and Mazda Moayeri and Soheil Feizi},
  journal= {arXiv preprint arXiv:2505.23001},
  year   = {2025}
}

备注

EMNLP2025 main, Camera-ready