多样性促进AI生成文本检测
计算与语言
2026-02-26 v3 人工智能
机器学习
摘要
检测AI生成文本已成为日益迫切的需求,以应对在教育、企业合规、新闻业和社交媒体中对LLM的滥用,在这些场景中,合成的流畅性可能掩盖虚假信息或欺骗。虽然先前的检测器通常依赖于词元级似然或不透明的黑盒分类器,但这些方法在应对高质量生成内容时表现不佳,且缺乏可解释性。在本工作中,我们提出了DivEye,一种新颖的检测框架,该框架利用基于惊异度的特征来捕捉文本中不可预测性的波动。受人类撰写文本在词汇和结构不可预测性上比LLM输出展现出更丰富变化的观察所启发,DivEye通过一组可解释的统计特征来捕捉这一信号。我们的方法在多个基准测试中比现有的零样本检测器最高提升了33.2%的性能,并与微调基线取得了具有竞争力的表现。DivEye对释义和对抗攻击具有鲁棒性,在不同领域和模型间具有良好的泛化能力,当作为辅助信号使用时,可将现有检测器的性能提升高达18.7%。除检测外,DivEye还提供了关于文本为何被标记的可解释见解,指出节奏不可预测性是LLM检测中一个强大且未被充分探索的信号。
引用
@article{arxiv.2509.18880,
title = {Diversity Boosts AI-Generated Text Detection},
author = {Advik Raj Basani and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2509.18880},
year = {2026}
}
备注
Accepted to Transactions on Machine Learning Research (TMLR '26). Project page and demos: https://diveye.vercel.app/