中文

模型生物体漏洞:Perplexity 差分常揭示精调目标

计算与语言 2026-05-05 v1 人工智能

摘要

精调可显著修改大型语言模型的行为,包括引入有害或不安全的行为。为研究这些风险,研究人员开发模型生物体:针对特定已知行为进行精调的模型,以进行受控实验。识别这些行为仍然具有挑战性。我们表明,一种简单的基于 perplexity 的方法可通过利用模型生物体倾向于超越预期语境对精调目标进行表面化。首先,我们使用从一般语料库中抽取的短随机 prefill 生成来自精调模型的多样化完成。其次,我们按降序排列完成项的 perplexity 差值(参考模型与精调模型之间)。排名靠前的完成项往往揭示了精调目标,无需模型内部或关于行为的先验假设。我们在 N=76 个模型生物体(参数范围从 0.5B 到 70B)上进行评估,包括后门模型、针对合成文档进行精调以内化错误事实的模型、在对抗性训练中隐藏担忧行为的模型,以及表现出新兴不对齐行为的模型。对于大多数测试的模型生物体,此方法在排名靠前的结果中揭示了精调目标,特别是通过合成文档进行精调或产生确切短语的模型最具易受性。我们进一步表明,即使没有访问确切的 pre-精调检查点,技术也同样有效:来自不同家族的可信参考模型可作为有效的替代品。由于该方法仅需要来自精调模型的下一个标记概率,因此与公开 API 限制模型(如仅暴露 token logprobs)兼容。

关键词

引用

@article{arxiv.2605.00994,
  title  = {Model Organisms Are Leaky: Perplexity Differencing Often Reveals Finetuning Objectives},
  author = {Mohammed Abu Baker and Luca Baroni and Dan Wilhelm},
  journal= {arXiv preprint arXiv:2605.00994},
  year   = {2026}
}