DEMASQ:揭穿 ChatGPT 的措辞伪装
密码学与安全
2023-11-10 v1 机器学习
摘要
ChatGPT 及其他大语言模型(LLM)的潜在滥用引发了人们对虚假信息传播、剽窃、学术不端和欺诈活动的担忧。因此,区分 AI 生成内容与人类生成内容已成为一个引人关注的研究课题。然而,当前的文本检测方法缺乏精度,且常局限于特定任务或领域,不足以识别 ChatGPT 生成的内容。本文中,我们提出一种名为 DEMASQ 的有效 ChatGPT 检测器,可准确识别 ChatGPT 生成的内容。我们的方法解决了两个关键因素:(i)人类与机器生成内容在文本构成上的明显偏差,以及(ii)人类为规避先前检测方法所做的改动。DEMASQ 是一种基于能量的检测模型,引入了新要素,如(i)受多普勒效应启发的优化以捕捉输入文本嵌入与输出标签间的相互依赖,以及(ii)使用可解释 AI 技术生成多样化扰动。为评估我们的检测器,我们创建了一个基准数据集,包含来自 ChatGPT 和人类的混合提示,涵盖医疗、开放问答、金融、维基和 Reddit 等领域。我们的评估表明 DEMASQ 在识别 ChatGPT 生成内容方面达到了高准确率。
引用
@article{arxiv.2311.05019,
title = {DEMASQ: Unmasking the ChatGPT Wordsmith},
author = {Kavita Kumari and Alessandro Pegoraro and Hossein Fereidooni and Ahmad-Reza Sadeghi},
journal= {arXiv preprint arXiv:2311.05019},
year = {2023}
}
备注
To appear in the Network and Distributed System Security (NDSS) Symposium 2024. 15 pages, 3 figures, 6 tables, 3 algorithms, 6 equations