SpecDetect:基于谱分析的 LLM 生成文本简单、快速且无训练检测
计算与语言
2026-01-13 v3
摘要
大型语言模型(LLM)生成的高质量文本的涌现,催生了可靠且高效的检测方法。虽然现有的无训练方法显示出前景,但它们往往依赖表层统计信息,忽视了文本生成过程的基本信号属性。本文将检测重新框定为信号处理问题,引入一种新范式,通过分析标记 log 概率序列在频域中的特性来实现检测。通过系统性地分析信号的谱特性 using 全局离散傅里叶变换(DFT)和局部短时傅里叶变换(STFT),我们发现人类撰写的文本在谱能上显著高于 LLM 生成的文本。这种更高能量反映了人类写作中固有的大幅度波动,与 LLM 生成文本中被抑制的动态性相对应。基于这一关键洞察,我们构建了 SpecDetect,一个基于全局 DFT 单一稳健特征:DFT 总能量的检测器。我们还提出了增强版 SpecDetect++,通过引入抽样差异机制进一步提升鲁棒性。大量实验表明,我们的方法在几乎缩短一半的时间内,超过了最新水平模型。我们的工作引入了一种新型、高效且可解释的 LLM 生成文本检测路径,表明经典信号处理技术为解决这一现代挑战提供了意想不到的强大解决方案。
关键词
引用
@article{arxiv.2508.11343,
title = {SpecDetect: Simple, Fast, and Training-Free Detection of LLM-Generated Text via Spectral Analysis},
author = {Haitong Luo and Weiyao Zhang and Suhang Wang and Wenji Zou and Chungang Lin and Xuying Meng and Yujun Zhang},
journal= {arXiv preprint arXiv:2508.11343},
year = {2026}
}
备注
AAAI'26 Oral