中文

RepreGuard:揭示隐藏表示模式以检测大语言模型生成文本

计算与语言 2025-08-19 v1 人工智能

摘要

检测由大语言模型(LLM)生成的内容对于防止滥用和构建可信赖的AI系统至关重要。尽管现有检测方法表现良好,但其在分布外(OOD)场景中的鲁棒性仍有不足。本文我们假设,与现有检测方法所使用的特征相比,LLM的内部表示包含更全面和原始的特征,能够更有效地捕捉和区分大语言模型生成文本(LGT)与人类撰写文本(HWT)之间的统计模式差异。我们在不同LLM上进行了验证,观察到处理这两种文本时神经激活模式存在显著差异。基于此,我们提出了RepreGuard,这是一种基于统计学的高效检测方法。具体而言,我们首先使用替代模型收集LGT和HWT的表示,并提取能够更好地识别LGT的独特激活特征。通过计算文本表示沿该特征方向的投影分数并与预计算的阈值进行比较,我们即可对文本进行分类。实验结果表明,RepreGuard在ID和OOD场景下均优于所有基线方法,平均AUROC达到94.92%,同时对各种文本规模和主流攻击具有稳健的抗性。数据和代码已公开available at:https://github.com/NLP2CT/RepreGuard

关键词

引用

@article{arxiv.2508.13152,
  title  = {RepreGuard: Detecting LLM-Generated Text by Revealing Hidden Representation Patterns},
  author = {Xin Chen and Junchao Wu and Shu Yang and Runzhe Zhan and Zeyu Wu and Ziyang Luo and Di Wang and Min Yang and Lidia S. Chao and Derek F. Wong},
  journal= {arXiv preprint arXiv:2508.13152},
  year   = {2025}
}

备注

Accepted to TACL 2025. This version is a pre-MIT Press publication version