我们可以信任 LLM 检测器吗?
计算与语言
2026-01-28 v2 人工智能
摘要
LLM 的快速普及增加了对可靠 AI 文本检测的需求,然而现有的检测器在受控基准测试之外往往会失效。我们系统性地评估了两种主流范式(无训练和有监督),并表明两者在分布偏移、未见过的生成器和简单的风格扰动下均表现脆弱。为了解决这些局限性,我们提出了一种有监督对比学习 (SCL) 框架,该框架学习具有判别性的风格嵌入。实验表明,虽然有监督检测器在同分布下表现优异,但在分布外会急剧退化,且无训练方法对代理选择仍然高度敏感。总体而言,我们的结果暴露了构建领域无关检测器所面临的根本性挑战。我们的代码可在以下地址获取:https://github.com/HARSHITJAIS14/DetectAI
引用
@article{arxiv.2601.15301,
title = {Can We Trust LLM Detectors?},
author = {Jivnesh Sandhan and Harshit Jaiswal and Fei Cheng and Yugo Murawaki},
journal= {arXiv preprint arXiv:2601.15301},
year = {2026}
}