细化来源推断:检测 LLM 细化训练提示的方法
机器学习
2026-01-06 v1 人工智能
摘要
指令调谐越来越依赖于基于 LLM 的提示细化,其中训练语料库中的提示被外部细化器选择性地重写以提高清晰度和指令对齐。这激励了一个实例级别的审计问题:对于一个微调模型和一条训练提示-响应对,我们能否推断出该模型是在原始提示还是其 LLM 细化版本上训练的(在混合语料库中)?这对于训练数据有争议时的资料治理和争议解决至关重要。然而,实际中并非如此简单:细化和原始实例在训练语料库中交错出现且混合比例未知,这使得开发能够跨模型和训练设置通用的来源方法变得更加困难。本文将该审计任务 formalized 为细化来源推断 (Refinement Provenance Inference, RPI),并指出提示细化即使在语义差异不明显时,也会导致教师强制 token 分布的稳定可检测的偏移。基于这一现象,我们提出了 RePro,一个基于 logit 的来源框架,该框架将教师强制概率特征与 logit 排序信号融合在一起。训练期间,RePro 通过影子微调学习可迁移的表示,并使用轻量级线性头在无训练数据访问的情况下对未见的受害者进行来源推断。经验上,RePro 持续实现卓越的性能并在不同细化器之间良好迁移,表明它利用的是细化器不可迁移的分布偏移,而非重写风格的痕迹。
引用
@article{arxiv.2601.01966,
title = {Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior},
author = {Bo Yin and Qi Li and Runpeng Yu and Xinchao Wang},
journal= {arXiv preprint arXiv:2601.01966},
year = {2026}
}