ChatGPT 还是学术科学家?利用现成机器学习工具以超过 99% 准确率区分作者身份
机器学习
2023-03-30 v1 计算与语言
摘要
ChatGPT 使大众得以使用 AI 生成文本,仅在数月之内,该产品便颠覆了知识经济,引发了人们工作、学习与写作方式的文化转变。区分人类写作与 AI 写作的需求如今既关键又紧迫,尤其在高等教育与学术写作等领域,AI 此前并非作者身份方面的重要威胁或贡献者。针对这一需求,我们开发了一种区分 ChatGPT 生成文本与(人类)学术科学家文本的方法,依赖于流行且易得的监督分类方法。我们聚焦于特定人类群体——学术科学家——与 ChatGPT 在写作上的差异,这种针对性方法促成了用于区分(这些)人类与 AI 的新特征的发现;例如,科学家撰写长段落且偏爱含糊措辞,频繁使用 but、however、although 等词。利用一组 20 个特征(包括上述特征及其他),我们构建了一个将作者判定为人类或 AI 的模型,准确率远超 99%,相较于领域领先方法误分类文档数减少 20 倍。这种区分特定人类群体与 AI 写作的策略可被具备监督分类基础技能的他人进一步适配与开发,从而能获得许多高准确率且具针对性的模型,用于检测学术写作及其他场景中的 AI 使用。
关键词
引用
@article{arxiv.2303.16352,
title = {ChatGPT or academic scientist? Distinguishing authorship with over 99% accuracy using off-the-shelf machine learning tools},
author = {Heather Desaire and Aleesa E. Chua and Madeline Isom and Romana Jarosova and David Hua},
journal= {arXiv preprint arXiv:2303.16352},
year = {2023}
}