中文

GPT-4 在位移与反转图灵测试中被认为比人类更像人类

人机交互 2024-07-15 v1 计算与语言

摘要

日常 AI 识别需要区分对话中人类与 AI。许多情况下,人们不会直接与 AI 系统交互,而是阅读 AI 与他人之间的对话。我们测量了人类与大语言模型在两种修改后的图灵测试版本(反转版与位移版)中的判别能力。GPT-3.5、GPT-4 以及位移人类裁判根据图灵测试记录判断代理人是人类还是 AI。我们发现,AI 与位移人类裁判的准确率均低于直接交互式询问者,整体准确率低于随机猜测。此外,所有三个裁判都更常地将表现最佳的 GPT-4 证人误判为人类。这表明,当他们没有主动询问对方时,人类和当前的大语言模型都难以区分两者,凸显了迫切需要更准确的工具来检测对话中的 AI。

关键词

引用

@article{arxiv.2407.08853,
  title  = {GPT-4 is judged more human than humans in displaced and inverted Turing tests},
  author = {Ishika Rathi and Sydney Taylor and Benjamin K. Bergen and Cameron R. Jones},
  journal= {arXiv preprint arXiv:2407.08853},
  year   = {2024}
}