中文

大型语言模型通过图灵测试

计算与语言 2025-04-01 v1 人机交互

摘要

我们对 4 个系统(ELIZA、GPT-4o、LLaMa-3.1-405B 和 GPT-4.5)进行了评估,进行了两个随机化、受控且预先登记的图灵测试,针对独立的人群。参与者在与另一名人类参与者和其中一个系统进行 5 分钟的对话后,判断哪个对话伙伴是人类。在被要求采用类似人类的角色时,GPT-4.5 被判断为人类的概率达 73%,显著高于评判者对真实人类参与者的选择率;LLaMa-3.1 在相同提示下被判断为人类的概率为 56%——并不显著高于或低于所比较的人类——而基线模型(ELIZA 和 GPT-4o)的获胜率分别显著低于随机水平(23% 和 21%)。本结果是首次证明任何人工智能系统通过标准三方图灵测试的实证证据。结果对关于大型语言模型(LLM)所展现智能类型以及这些系统可能产生的社会和经济影响的争论具有启发意义。

关键词

引用

@article{arxiv.2503.23674,
  title  = {Large Language Models Pass the Turing Test},
  author = {Cameron R. Jones and Benjamin K. Bergen},
  journal= {arXiv preprint arXiv:2503.23674},
  year   = {2025}
}