TURINGBENCH:神经文本生成时代的图灵测试基准环境
计算与语言
2021-09-29 v1
摘要
生成式语言模型的最新进展使机器能够生成极为逼真的文本。尽管此类模型有许多合法应用,但区分机器生成文本与人类撰写文本(例如假新闻检测)的需求也日益上升。然而,据我们所知,目前尚无包含数据集与任务的基准环境来系统研究神经文本生成方法中的所谓“图灵测试”问题。在本工作中,我们提出 TuringBench 基准环境,其包含:(1) 一个包含 200K 个人类或机器生成样本的数据集,涵盖 20 个标签 {Human, GPT-1, GPT-2_small, GPT-2_medium, GPT-2_large, GPT-2_xl, GPT-2_PyTorch, GPT-3, GROVER_base, GROVER_large, GROVER_mega, CTRL, XLM, XLNET_base, XLNET_large, FAIR_wmt19, FAIR_wmt20, TRANSFORMER_XL, PPLM_distil, PPLM_gpt2};(2) 两项基准任务——即图灵测试(TT)与作者归属(AA);(3) 一个带有排行榜的网站。我们使用 TuringBench 的初步实验结果表明,在所有受测语言模型中,FAIR_wmt20 与 GPT-3 凭借五个最先进 TT 检测模型给出的最低 F1 分数,成为生成最具人类相似度、最难区分文本的当前胜出者。TuringBench 可在 https://turingbench.ist.psu.edu/ 获取。
引用
@article{arxiv.2109.13296,
title = {TURINGBENCH: A Benchmark Environment for Turing Test in the Age of Neural Text Generation},
author = {Adaku Uchendu and Zeyu Ma and Thai Le and Rui Zhang and Dongwon Lee},
journal= {arXiv preprint arXiv:2109.13296},
year = {2021}
}
备注
Accepted to Findings of EMNLP 2021