中文

TAB-AUDIT:基于多视图概率不匹配检测 AI 生成的科学表格

计算与语言 2026-03-23 v1

摘要

AI 生成的虚假科学手稿正在引发日益增长的学术诚信大规模违规的担忧。本工作提出了 TAB-AUDIT 框架,首次系统性地研究了检测 AI 生成的虚假科学表格。由于表格中的信息是论点关键证据,本文聚焦于经典 NLP 论文中的虚假表格。我们构建了 FabTab 数据集,首个包含人工智能生成论文和人类撰写论文的基准数据集,共计 1,173 篇 AI 生成论文和 1,215 篇人类撰写论文。通过全面分析,我们识别出虚假表格与真实表格之间的系统性差异,并将其转化为 TAB-AUDIT 框架中的一组判别性特征。关键特征——表格内部不匹配——捕捉了表格结构与其数值内容之间的困惑度差距。实验结果表明,基于这些特征的 RandomForest 方法在同一领域内达到了 0.987 的 AUROC,在跨领域内达到了 0.883 的 AUROC,显著优于现有的领先方法。我们的发现凸显实验表格是检测 AI 生成科学欺诈的关键 Forensic 信号,并为未来研究提供了新的基准。

关键词

引用

@article{arxiv.2603.19712,
  title  = {TAB-AUDIT: Detecting AI-Fabricated Scientific Tables via Multi-View Likelihood Mismatch},
  author = {Shuo Huang and Yan Pen and Lizhen Qu},
  journal= {arXiv preprint arXiv:2603.19712},
  year   = {2026}
}