CHEAT:用于检测 ChatGPT 生成摘要的大规模数据集
计算与语言
2024-02-27 v2
摘要
ChatGPT 的强大能力引起了学术界的广泛关注。恶意用户可通过 ChatGPT 合成虚假学术内容,这对学术严谨性与原创性危害极大。开发 ChatGPT 生成内容检测算法的需求呼唤大规模数据集。本文首先探讨了 ChatGPT 对学术界可能造成的负面影响,并提出了一个大规模 ChatGPT 生成摘要数据集(CHEAT)以支持检测算法的开发。具体而言,该 ChatGPT 生成摘要数据集包含 35,304 篇合成摘要,以生成(Generation)、润色(Polish)和混合(Mix)为主要代表。基于这些数据,我们对现有文本合成检测算法进行了深入分析。我们表明 ChatGPT 生成的摘要在可检测范围内,但检测难度随人工参与程度增加而上升。我们的数据集可在 https://github.com/botianzhe/CHEAT 获取。
引用
@article{arxiv.2304.12008,
title = {CHEAT: A Large-scale Dataset for Detecting ChatGPT-writtEn AbsTracts},
author = {Peipeng Yu and Jiahan Chen and Xuan Feng and Zhihua Xia},
journal= {arXiv preprint arXiv:2304.12008},
year = {2024}
}
备注
9 pages, 6 figures