中文

在图灵测试中人们无法区分GPT-4与人类

人机交互 2024-05-15 v1 人工智能

摘要

我们在一个随机化、对照且预先注册的图灵测试中评估了三个系统(ELIZA、GPT-3.5和GPT-4)。人类参与者与人类或AI进行5分钟的对话,并判断他们认为对话者是否为人类。GPT-4在54%的情况下被判断为人类,优于ELIZA(22%),但落后于真实人类(67%)。这些结果首次提供了任何人工智能系统通过交互式双人图灵测试的可靠实证证明。这些结果对围绕机器智能的辩论具有启示意义,并且更紧迫的是,表明当前AI系统的欺骗行为可能未被察觉。对参与者策略和推理的分析表明,风格和社会情感因素在图灵测试中比传统的智能概念发挥更大的作用。

关键词

引用

@article{arxiv.2405.08007,
  title  = {People cannot distinguish GPT-4 from a human in a Turing test},
  author = {Cameron R. Jones and Benjamin K. Bergen},
  journal= {arXiv preprint arXiv:2405.08007},
  year   = {2024}
}

备注

23 pages, 13 figures