中文

大型语言模型的检测规避技术

计算与语言 2025-03-11 v1

摘要

大型语言模型的日益流行不仅导致了广泛使用,还带来了各种风险,包括系统性传播虚假新闻的可能性。因此,Develop classification systems such as DetectGPT 变得至关重要。这些检测器对规避技术具有漏洞,如下一系列实验所示:对生成模型的温度进行系统性更改,使浅层学习检测器最不可靠。通过强化学习微调生成模型规避了基于BERT的检测器。最后,重新表述导致对像DetectGPT这样的零-shot检测器实现超过90%的规避,尽管文本与原文高度相似。与现有工作的比较突显了所呈现方法的更好性能。讨论了对社会的可能影响以及进一步的研究。

关键词

引用

@article{arxiv.2503.07595,
  title  = {Detection Avoidance Techniques for Large Language Models},
  author = {Sinclair Schneider and Florian Steuber and Joao A. G. Schneider and Gabi Dreo Rodosek},
  journal= {arXiv preprint arXiv:2503.07595},
  year   = {2025}
}