论面向大语言模型的微调在检测AI生成文本中的有效性
计算与语言
2026-01-29 v1 人工智能
摘要
大语言模型的快速进步使得生成的文本与人类写作极为相似,给教育、出版和数字安全领域的真实性验证带来了挑战。因此,检测AI生成文本已成为一个关键的技术和伦理问题。本文基于大规模语料库和新颖的训练策略,对AI生成文本检测进行了全面研究。我们引入了一个包含10亿词符的人类撰写文本语料库,涵盖多种体裁,以及一个通过提示各种大语言模型在不同领域生成的19亿词符的AI生成文本语料库。利用这些资源,我们开发并评估了多种检测模型,提出了两种新的训练范式:逐大语言模型微调和逐大语言模型族微调。在一个覆盖21个大语言模型、包含1亿词符的基准测试中,我们最佳的微调检测器实现了高达99.6%的词符级准确率,显著优于现有的开源基线方法。
引用
@article{arxiv.2601.20006,
title = {On the Effectiveness of LLM-Specific Fine-Tuning for Detecting AI-Generated Text},
author = {Michał Gromadzki and Anna Wróblewska and Agnieszka Kaliska},
journal= {arXiv preprint arXiv:2601.20006},
year = {2026}
}
备注
34 pages, 6 figures. Under review at Information Sciences