中文

图灵欺骗

机器学习 2022-12-27 v2 人工智能 计算与语言

摘要

本研究重访经典的图灵测试,并比较近期的大语言模型(LLM)如 ChatGPT 在再现人类水平理解与引人入胜的文本生成方面的能力。两项任务挑战——摘要与问答——促使 ChatGPT 从单条文本条目以及图灵于 1950 年最初提出的连续问题中生成原创内容(98-99%)。我们将原始内容与生成内容对照 2019 年的 OpenAI GPT-2 Output Detector 进行评分,并确立了多个生成内容被证明为原创且不可检测(98%)的案例。在这项工作中,机器欺骗人类评判者的问题相较于“如何证明它?”的问题退居次要。该工作的原创贡献提出了一个度量指标与简单的语法集合,用于理解聊天机器人在评估其可读性、统计清晰度、参与度、传达性及整体质量时的写作机制。尽管图灵的原始散文得分至少比机器生成输出低 14%,但算法是否显示出图灵真正原创思想的迹象(即“Lovelace 2.0”测试)这一问题仍未得到解答,且目前可能无解。

关键词

引用

@article{arxiv.2212.06721,
  title  = {The Turing Deception},
  author = {David Noever and Matt Ciolino},
  journal= {arXiv preprint arXiv:2212.06721},
  year   = {2022}
}