ChatGPT-4 与其他 LLM 在图灵测试中的批判性分析
人工智能
2025-12-30 v4 计算机与社会
人机交互
摘要
本文对 Restrepo Echavarría (2025) 近期发表的论文《ChatGPT-4 在图灵测试中》进行了批判性审视,质疑其关于缺乏最起码的严肃测试实现以及 ChatGPT-4 未能通过图灵测试的核心主张。分析表明,基于僵化标准和有限实验数据的批评并不完全合理。更重要的是,本文做出了若干建设性贡献,丰富了我们对图灵测试实现的理解。本文证明了三玩家和两玩家测试这两种不同格式都是有效的,各自具有独特的方法论意义。本文区分了通过测试的绝对标准——机器被错误识别的概率等于或超过人类被正确识别的概率——与相对标准——衡量机器表现接近人类程度的程度——提供了一个更细致的评估框架。此外,本文通过将两种测试类型建模为伯努利实验(三玩家版本中相关,两玩家版本中不相关),澄清了它们的概率基础。这种形式化允许在以概率术语定义的通过测试的理论标准与需要稳健统计方法进行正确解释的实验数据之间进行严格分离。在此过程中,本文不仅反驳了受批评研究的关键方面,而且为未来关于客观衡量 AI 行为与人类行为一致或偏离程度的研究奠定了坚实基础。
引用
@article{arxiv.2503.06551,
title = {ChatGPT-4 and other LLMs in the Turing Test: A Critical Analysis},
author = {Marco Giunti},
journal= {arXiv preprint arXiv:2503.06551},
year = {2025}
}
备注
v1 14 pages, 1 Appendix; v2 added 1 missing item in References, corrected typos; v3 corrected typos; v4 fully revised, 15 pages, 1 Appendix, forthcoming in Minds and Machines