AI 检测器真的足够好了吗?关于机器生成文本数据集质量的调查
计算与语言
2025-03-10 v3
摘要
自回归式大语言模型(LLM)的快速发展显著提升了生成文本的质量,亟需可靠的机器生成文本检测器。大量检测器和包含AI片段的数据集涌现,甚至有些检测方法在目标指标下显示出最高达99.9%的识别质量。然而,这些检测器的质量在实际应用中会大幅下降,这引发了一个问题:检测器是否真的高度可信,还是它们的高基准分数源于评估数据集质量的差劲?本文强调,需制定稳健且定性的方法来评估生成数据,以确保其免受偏见和未来模型泛化能力不足的影响。我们系统性地审查了专为AI生成内容检测而设的竞赛数据集,并提出评估包含AI生成片段数据集质量的方法。此外,我们讨论了使用高质量生成数据以实现两个目标的可能性:改进检测模型训练以及改进训练数据集本身。我们的贡献旨在促进对人类与机器文本之间动态关系的更好理解,从而最终支持日益自动化的世界中信息的完整性。代码已公开于https://github.com/Advacheck-OU/ai-dataset-analysing。
引用
@article{arxiv.2410.14677,
title = {Are AI Detectors Good Enough? A Survey on Quality of Datasets With Machine-Generated Texts},
author = {German Gritsai and Anastasia Voznyuk and Andrey Grabovoy and Yury Chekhovich},
journal= {arXiv preprint arXiv:2410.14677},
year = {2025}
}
备注
Presented at Preventing and Detecting LLM Misinformation (PDLM) at AAAI 2025