GPT-3文本与人类文本不可区分吗?Scarecrow:审视机器文本的框架
计算与语言
2022-03-09 v3
摘要
现代神经语言模型可生成显著流畅且合乎语法的文本。事实上如此之多,以至于Clark等人(2021)近期的工作报告称,常规众包已无法可靠区分机器创作(GPT-3)与人类创作的写作。随着机器生成中的错误变得愈发微妙且难以察觉,这对研究界提出了鲁棒机器文本评估的新挑战。我们提出一个名为Scarecrow的新框架,通过众包标注审视机器文本。为支持外行可识别的广泛真实机器错误,Scarecrow的十个错误类别——如冗余、常识错误与 incoherence(不连贯)——是通过多轮无预定义本体的众包标注实验确定的。我们随后使用Scarecrow收集了英语新闻文本中人类撰写与机器生成段落超过41k个错误跨度。我们隔离因素用于详细分析,包括参数数量、训练数据与各种解码时配置。我们的方法成功量化了人类创作文本与多种规模模型(包括GPT-3的十四种配置)生成之间的可测量差距。此外,我们的分析揭示了新见解,由外行提供详细理由,例如常识能力随更大模型而提升而数学能力未提升,以及简单解码超参数的选择可对机器文本的感知质量产生显著差异。我们在 https://yao-dou.github.io/scarecrow/ 发布我们的训练材料、标注工具包与数据集。
引用
@article{arxiv.2107.01294,
title = {Is GPT-3 Text Indistinguishable from Human Text? Scarecrow: A Framework for Scrutinizing Machine Text},
author = {Yao Dou and Maxwell Forbes and Rik Koncel-Kedziorski and Noah A. Smith and Yejin Choi},
journal= {arXiv preprint arXiv:2107.01294},
year = {2022}
}
备注
The project webpage is at https://yao-dou.github.io/scarecrow/