Alignment Imprint:基于可证明偏好差异的零样态 AI 生成文本检测
人工智能
2026-04-21 v1
摘要
检测 AI 生成文本是一项重要但具有挑战性的任务。现有的基于似然性的方法常常对内容复杂度敏感,并可能表现出不稳定的性能。在本文中,我们的关键洞察是,现代大型语言模型(LLM)在对齐过程中(包括微调和偏好微调)会留下可测量的分布性痕迹。我们通过将对齐过程抽象为一系列受约束的优化步骤,理论上推导了该痕迹,表明对数似然比自然分解为隐式指令偏差和偏好奖励。我们将该数量称为对齐痕迹(Alignment Imprint)。此外,为缓解高熵区域中的不稳定性,我们引入基于对齐痕迹的对数似然偏好差异(Log-likelihood Alignment Preference Discrepancy, LAPD),这是一种基于对齐痕迹的标准化信息加权统计量。我们提供了统计保证,表明基于对齐的统计量在性能上优于 Fast-DetectGPT。我们也理论上表明,当对齐模型和基础模型在分布上接近时,LAPD 严格改进了未加权对齐得分。大量实验表明,LAPD 相对于最强现有基线实现了 45.82% 的提升,在所有设置下均取得显著且一致的性能提升。
引用
@article{arxiv.2604.16923,
title = {Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy},
author = {Junxi Wu and Kailin Huang and Dongjian Hu and Bin Chen and Hao Wu and Shu-Tao Xia and Changliang Zou},
journal= {arXiv preprint arXiv:2604.16923},
year = {2026}
}