ChatGPT离人类专家有多近?对比语料库、评估与检测
计算与语言
2023-01-19 v1
摘要
ChatGPT的推出在学术界和工业界都引起了广泛关注。ChatGPT能够有效回应广泛的人类问题,提供流畅且全面的回答,在安全性和实用性方面显著超越以往的公开聊天机器人。一方面,人们好奇ChatGPT是如何取得如此能力,以及它离人类专家还有多远。另一方面,人们开始担忧诸如ChatGPT这样的大语言模型(LLMs)可能对社会产生的负面影响,例如假新闻、剽窃和社会安全问题。在本工作中,我们收集了来自人类专家和ChatGPT的数万条对比回答,问题涵盖开放域、金融、医学、法律和心理领域。我们将所收集的数据集称为人类-ChatGPT对比语料库(HC3)。基于HC3数据集,我们研究了ChatGPT回答的特征、与人类专家的差异和差距,以及LLMs的未来方向。我们对ChatGPT生成内容与人类内容进行了全面的人工评估和语言学分析,其中揭示了许多有趣的结果。此后,我们就如何有效检测某段文本由ChatGPT还是人类生成进行了大量实验。我们构建了三种不同的检测系统,探究了若干影响其有效性的关键因素,并在不同场景下进行了评估。数据集、代码和模型均已公开于 https://github.com/Hello-SimpleAI/chatgpt-comparison-detection。
引用
@article{arxiv.2301.07597,
title = {How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and Detection},
author = {Biyang Guo and Xin Zhang and Ziyuan Wang and Minqi Jiang and Jinran Nie and Yuxuan Ding and Jianwei Yue and Yupeng Wu},
journal= {arXiv preprint arXiv:2301.07597},
year = {2023}
}
备注
https://github.com/Hello-SimpleAI/chatgpt-comparison-detection