中文

机器生成文本可被多好地识别,且语言模型能否被训练以规避识别?

计算与语言 2023-10-27 v1

摘要

随着 GPT-3、GPT-NeoX 或 OPT 等生成式预训练 transformer 模型的兴起,区分人类生成文本与机器生成文本变得重要。我们微调了五个独立的语言模型以生成合成推文,发现朴素贝叶斯等浅层学习分类算法的检测准确率在 0.6 至 0.8 之间。浅层学习分类器不同于基于人类的检测,尤其当文本生成中使用较高温度值时,导致检测率降低。人类优先考虑语言可接受性,而该性质在较低温度值下往往更高。相比之下,基于 transformer 的分类器准确率达 0.9 及以上。我们发现,使用强化学习方法来微调生成模型,可成功规避基于 BERT 的分类器,其检测准确率在 0.15 或以下。

关键词

引用

@article{arxiv.2310.16992,
  title  = {How well can machine-generated texts be identified and can language models be trained to avoid identification?},
  author = {Sinclair Schneider and Florian Steuber and Joao A. G. Schneider and Gabi Dreo Rodosek},
  journal= {arXiv preprint arXiv:2310.16992},
  year   = {2023}
}

备注

This paper has been accepted for the upcoming 57th Hawaii International Conference on System Sciences (HICSS-57)