中文

$k$NNProxy:用于黑盒零样图 LLM 生成文本检测的高效训练-free 代理对齐

计算与语言 2026-04-03 v1

摘要

LLM 生成文本 (LGT) 检测对于可靠的 Forensic 分析以及缓解 LLM 误用至关重要。现有的 LGT 检测器通常可分为两大类:基于学习的方法和零 shot 方法。与基于学习的检测器相比,零 shot 方法尤其有前景,因为它们消除了对 task-specific 分类器的训练需求。然而,零 shot 方法的可靠性根本依赖于假设即插即用代理 LLM 与未知源 LLM 高度对齐,这一前提在现实的黑盒场景中很少成立。为解决这一差异,现有的代理对齐方法通常依赖于代理的监督微调或与商业 API 的反复交互,从而增加部署成本、使检测器暴露于静默 API 变更,并限制其在 domain 迁移下的鲁棒性。受这些限制的启发,我们提出了 kk-最近邻代理 (kkNNProxy),一种 training-free 且 query-efficient 的代理对齐框架,将 kkNN language model (kkNN-LM) 检索机制用作固定代理 LLM 的 domain adapter。具体而言,一次性构建一个轻量级 datastore,从目标反射 LGT 语料库中获得,或通过固定预算查询或从现有数据集中获得。在推理期间,最近邻证据会引导 token 级预测分布与代理输出进行插值,从而在无代理微调或 per-token API 输出的情况下获得对齐预测。为提高 domain 迁移下的鲁棒性,我们将 kkNNProxy 扩展为代理混合 (MoP),为每个输入路由到特定 domain 的 datastore,以实现 domain-consistent 检索。大量实验表明,我们的方法在检测性能方面表现优异。

关键词

引用

@article{arxiv.2604.02008,
  title  = {$k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection},
  author = {Kahim Wong and Kemou Li and Haiwei Wu and Jiantao Zhou},
  journal= {arXiv preprint arXiv:2604.02008},
  year   = {2026}
}