中文

基于对比学习和结构校准的 AI 生成科学文本的句子级检测

计算与语言 2025-10-02 v1 人工智能

摘要

大型语言模型(LLM)在科学写作中的快速采用引发了关于作者完整性和学术出版物可靠性的严重关切。现有检测方法主要依赖文档级分类或表面级统计线索;然而,它们忽略了细粒度的 span 定位,校准性弱,常常难以在不同学科和生成器之间泛化。为此,我们提出 Sci-SpanDet,一个结构感知框架,用于检测 AI 生成的学术文本。该方法结合了章节条件风格建模和多级对比学习,以捕捉人类-AI 细微差异,同时减轻主题依赖,从而增强跨域鲁棒性。此外,它集成了 BIO-CRF 序列标注与基于指针的边界解码和置信度校准,以实现精确的 span 级检测和可靠的概率估计。广泛的实验在新建构的跨学科数据集(包含 100,000 个由多个 LLM 系列(GPT、Qwen、DeepSeek、LLaMA) 生成的注释样本)上表明,Sci-SpanDet 实现了最先进的性能,F1(AI) 为 80.17,AUROC 为 92.63,Span-F1 为 74.36。此外,它在对抗性改写下表现出强大的韧性,并在 IMRaD 各章节和不同学科之间保持平衡准确率,显著超越现有基准。为确保可重复性并促进学术文档中 AI 生成文本检测的进一步研究,精选数据集和源代码将在公开发布后公开。

关键词

引用

@article{arxiv.2510.00890,
  title  = {Span-level Detection of AI-generated Scientific Text via Contrastive Learning and Structural Calibration},
  author = {Zhen Yin and Shenghua Wang},
  journal= {arXiv preprint arXiv:2510.00890},
  year   = {2025}
}