中文

你能跟上我吗?测试 ChatGPT 中的情境理解能力

计算与语言 2023-10-26 v1

摘要

理解句子含义并随时间恰当更新信息状态——我们称之为“情境理解”(SU)——是类人 AI 智能体的关键能力。SU 尤其对 ChatGPT 等聊天模型至关重要,以实现人与 AI 之间一致、连贯且高效的对话。已有工作识别了非聊天型大语言模型(LLM)的某些 SU 局限,但这些局限的程度与成因尚不清楚,且当前基于聊天的模型在此领域的能力未被探索。本文中我们着手解决这些问题,提出一种新颖的 SU 测试合成环境,通过对模型追踪与枚举环境状态能力的评估,实现对面向聊天模型的 SU 受控且系统的测试。我们的环境亦允许对模型表现的动态做细致分析,以更好理解表现模式背后的潜在成因。我们将测试应用于 SOTA 聊天机器人 ChatGPT,发现尽管任务本质简单,模型表现反映出其无法跨时间保留正确环境状态。后续分析表明,性能退化主要因为 ChatGPT 具有非持久上下文记忆(尽管其可访问完整对话历史)且易受幻觉式更新影响——包括人为抬高准确率的更新。我们的发现总体表明 ChatGPT 目前不具备稳健追踪情境状态的能力,且对 ChatGPT 令人印象深刻的对话表现的信任伴随风险。我们在 https://github.com/yangalan123/SituationalTesting 发布了复现测试环境的代码库及来自 ChatGPT 的所有提示词与 API 响应。

关键词

引用

@article{arxiv.2310.16135,
  title  = {Can You Follow Me? Testing Situational Understanding in ChatGPT},
  author = {Chenghao Yang and Allyson Ettinger},
  journal= {arXiv preprint arXiv:2310.16135},
  year   = {2023}
}

备注

EMNLP 2023 Main Paper (Camera Ready)