大型语言模型生成文本检测器的实用评估
计算与语言
2025-02-11 v4 人工智能
摘要
大型语言模型的不断涌现引发日益担忧,尤其是当AI生成的文本被错误归因于人类作者时。机器生成内容检测器声称能在各种条件下有效识别此类文本。本文通过在多个领域、数据集和模型上评估(这些检测器此前未接触过的场景),批判性地检验了这些宣称。我们采用多种提示策略模拟实际对抗攻击,证明即使有限的努力即可显著规避检测。我们强调以特定虚假正例率下的真阳性率(TPR@FPR)指标的重要性,展示这些检测器在某些情境下表现不佳,[email protected] 可低至0%。我们的发现表明,无论是经过训练的检测器还是零样本检测器,都难以在保持较高灵敏度的同时实现合理的真阳性率。
引用
@article{arxiv.2412.05139,
title = {A Practical Examination of AI-Generated Text Detectors for Large Language Models},
author = {Brian Tufts and Xuandong Zhao and Lei Li},
journal= {arXiv preprint arXiv:2412.05139},
year = {2025}
}
备注
9 pages