中文

使用 Transformer 模型集成检测生成的科学论文

计算与语言 2022-10-18 v1 人工智能 机器学习

摘要

本文描述了为第三届学术文档处理研讨会举办的 DAGPap22 共享任务开发的神经模型。该共享任务旨在自动检测生成的科学论文。我们的工作侧重于比较不同的基于 transformer 的模型,以及使用额外的数据集和技术来处理类别不平衡问题。作为最终提交,我们利用了使用随机过采样技术微调的 SciBERT、RoBERTa 和 DeBERTa 的集成。我们的模型在 F1 分数上达到了 99.24%。官方评估结果使我们的系统位列第三。

关键词

引用

@article{arxiv.2209.08283,
  title  = {Detecting Generated Scientific Papers using an Ensemble of Transformer Models},
  author = {Anna Glazkova and Maksim Glazkov},
  journal= {arXiv preprint arXiv:2209.08283},
  year   = {2022}
}

备注

Accepted to SDP 2022 (Third Workshop on Scholarly Document Processing collocated with COLING 2022)