大型语言模型的检测规避技术
计算与语言
2025-03-11 v1
摘要
大型语言模型的日益流行不仅导致了广泛使用,还带来了各种风险,包括系统性传播虚假新闻的可能性。因此,Develop classification systems such as DetectGPT 变得至关重要。这些检测器对规避技术具有漏洞,如下一系列实验所示:对生成模型的温度进行系统性更改,使浅层学习检测器最不可靠。通过强化学习微调生成模型规避了基于BERT的检测器。最后,重新表述导致对像DetectGPT这样的零-shot检测器实现超过90%的规避,尽管文本与原文高度相似。与现有工作的比较突显了所呈现方法的更好性能。讨论了对社会的可能影响以及进一步的研究。
引用
@article{arxiv.2503.07595,
title = {Detection Avoidance Techniques for Large Language Models},
author = {Sinclair Schneider and Florian Steuber and Joao A. G. Schneider and Gabi Dreo Rodosek},
journal= {arXiv preprint arXiv:2503.07595},
year = {2025}
}