DACTYL:源自大语言模型的多样化对抗性文本语料库
计算与语言
2025-08-04 v1 机器学习
摘要
现有AIG(AI生成)文本检测器在内部测试中表现成功,但在真实场景中却难以应对,这表明它们可能不够鲁棒。我们严格审视了构建这些检测器的机器学习流程以解决此问题。当前大多数AIG文本检测数据集关注零样本生成,但很少有工作涉及少样本或单样本生成,即LLM以人类文本为示例进行生成。为此,我们引入了源自语言模型的多样化对抗性文本语料库(DACTYL),这是一个具有挑战性的AIG文本检测数据集,专注于单样本/少样本生成。我们还包含了来自领域特定持续预训练(CPT)语言模型的文本,其中我们使用一种内存高效的优化方法完全训练了所有参数。许多现有的AIG文本检测器在我们的数据集上表现显著困难,表明它们对单样本/少样本和CPT生成的文本存在潜在脆弱性。我们还使用两种方法训练了我们自己的分类器:标准二元交叉熵(BCE)优化和一种较新的方法——深度X风险优化(DXO)。虽然BCE训练的分类器在DACTYL测试集上略优于DXO分类器,但后者在分布外(OOD)文本上表现出色。在我们使用OOD学生论文数据集进行的模拟学生论文检测部署场景中,对于两者最低的假阳性率,最佳DXO分类器的宏F1分数比最佳BCE训练的分类器高出50.56分。我们的结果表明,DXO分类器泛化能力更好,不会过拟合测试集。我们的实验突出了AIG文本检测器需要改进的几个方面。
引用
@article{arxiv.2508.00619,
title = {DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models},
author = {Shantanu Thorat and Andrew Caines},
journal= {arXiv preprint arXiv:2508.00619},
year = {2025}
}
备注
MPhil in Advanced Computer Science thesis for University of Cambridge