中文

SynSciPass:检测科学文本生成的恰当使用

计算与语言 2022-09-13 v2 数字图书馆

摘要

机器生成文本检测方法往往聚焦于人类与机器撰写文本的二分类。在科学领域,出版商可能使用这些模型审查投稿稿件,误分类可能对作者造成伤害。此外,作者可能恰当地使用文本生成模型,例如借助翻译工具等辅助技术。在此情形下,二分类方案可能将辅助文本生成技术的恰当使用误标为单纯的机器生成,这是一个令人担忧的问题。在我们的工作中,我们通过呈现一个在 DAGPap22 上训练的最先进检测器,并使用来自 Scielo 的机器翻译段落进行模拟,发现该模型表现如同随机。鉴于此发现,我们开发了一个数据集构建框架,通过对所用技术类型(如翻译或释义)进行标注,提供检测机器生成文本的细致方法,从而构建了 SynSciPass。通过在 SynSciPass 上训练在 DAGPap22 上表现良好的同一模型,我们表明该模型不仅对领域偏移更鲁棒,而且能够揭示机器生成文本所用技术的类型。尽管如此,我们得出结论:当前数据集既不够全面也不够真实,无法理解这些模型在未知或新颖分布可能来源的稿件投稿等真实环境中如何表现,在科学全文而非小段落上如何表现,以及当自然语言的恰当与不恰当使用混合时会发生什么。

关键词

引用

@article{arxiv.2209.03742,
  title  = {SynSciPass: detecting appropriate uses of scientific text generation},
  author = {Domenic Rosati},
  journal= {arXiv preprint arXiv:2209.03742},
  year   = {2022}
}

备注

Accepted to SDProc 2022 Workshop @ COLING 2022 (First Place Submission on https://www.kaggle.com/competitions/detecting-generated-scientific-papers/leaderboard)