用 CogEval 评估大语言模型的认知地图与规划能力
人工智能
2023-09-28 v1 计算与语言
机器学习
摘要
近期大量研究声称大语言模型(LLMs)中具有涌现认知能力。然而,多数依赖于轶事,忽视训练集的污染,或缺乏涉及多任务、控制条件、多次迭代与统计稳健性检验的系统性评估。在此我们做出两项主要贡献。第一,我们提出 CogEval,一种受认知科学启发的、用于系统评估大语言模型认知能力的协议。CogEval 协议可遵循以评估多种能力。第二,我们在此遵循 CogEval 系统评估了八个 LLMs(OpenAI GPT-4、GPT-3.5-turbo-175B、davinci-003-175B、Google Bard、Cohere-xlarge-52.4B、Anthropic Claude-1-52B、LLaMA-13B 与 Alpaca-7B)的认知地图与规划能力。我们的任务提示基于人类实验,其既提供评估规划的既定构念效度,又 absent 于 LLM 训练集。我们发现,尽管 LLMs 在少数结构较简单的规划任务中表现出明显能力,系统性评估揭示了其在规划任务中的惊人失败模式,包括无效轨迹的幻觉与陷入循环。这些发现不支持 LLMs 中具有开箱即用的涌现规划能力的观点。这可能是因为 LLMs 不理解规划问题底层的潜在关系结构(即认知地图),并无法基于底层结构展开目标导向轨迹。文中讨论了应用启示与未来方向。
引用
@article{arxiv.2309.15129,
title = {Evaluating Cognitive Maps and Planning in Large Language Models with CogEval},
author = {Ida Momennejad and Hosein Hasanbeig and Felipe Vieira and Hiteshi Sharma and Robert Osazuwa Ness and Nebojsa Jojic and Hamid Palangi and Jonathan Larson},
journal= {arXiv preprint arXiv:2309.15129},
year = {2023}
}