机器人还是人类?用单个问题检测 ChatGPT 冒名者
计算与语言
2024-08-13 v4
摘要
像 GPT-4 这样的大语言模型(LLMs)近期在自然语言理解与生成方面展现出令人印象深刻的能力。然而,人们担忧它们可能被滥用于恶意目的,例如欺诈或拒绝服务攻击。因此,开发用于检测对话参与方是机器人还是人类的方法至关重要。在本文中,我们提出一个名为 FLAIR(通过单次询问与回复发现大语言模型真实性)的框架,以在线方式检测对话机器人。具体而言,我们针对能够有效区分人类用户与机器人的单个问题场景。问题分为两类:对人类容易但对机器人困难的问题(例如计数、替换、搜索和 ASCII 艺术推理),以及对于机器人容易但对人类困难的问题(例如记忆与计算)。我们的方法展示了这些问题在有效性上的不同优势,为在线服务提供商保护自己免受恶意活动提供了一种新途径。我们的代码和问题集可在 https://github.com/hongwang600/FLAIR 获取。
引用
@article{arxiv.2305.06424,
title = {Bot or Human? Detecting ChatGPT Imposters with A Single Question},
author = {Hong Wang and Xuan Luo and Weizhi Wang and Xifeng Yan},
journal= {arXiv preprint arXiv:2305.06424},
year = {2024}
}