LLM 的随机鸭子现象:物理概念理解的综合评估
计算与语言
2025-02-14 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
我们以系统性方式探讨了一个广受关注的问题:LLM 是否真正理解它们所说的内容,这涉及更熟悉的术语“随机鸭子”。为此,我们提出了一个针对精心设计的物理概念理解任务(PhysiCo)的综合评估。该任务通过采用网格格式的输入来缓解记忆问题,这些输入抽象地描述了物理现象。网格代表从核心现象、应用示例到类比以及对其他抽象模式的理解的不同层次。对该任务的全面研究表明:(1) 最先进的 LLM 包括 GPT-4o、o1 和 Gemini 2.0 flash thinking 相较于人类落后约 40%;(2) 随机鸭子现象存在于 LLM 中,由于它们在网格任务中失败,但在自然语言中能良好描述和识别相同的概念;(3) 该任务之所以挑战 LLM,源于内在困难,而非不熟悉的网格格式,因为对相同格式数据的原地学习和微调对其性能贡献有限。
引用
@article{arxiv.2502.08946,
title = {The Stochastic Parrot on LLM's Shoulder: A Summative Assessment of Physical Concept Understanding},
author = {Mo Yu and Lemao Liu and Junjie Wu and Tsz Ting Chung and Shunchi Zhang and Jiangnan Li and Dit-Yan Yeung and Jie Zhou},
journal= {arXiv preprint arXiv:2502.08946},
year = {2025}
}
备注
NAACL 2025 Main Conference. First 5 authors contributed equally. Project page: https://physico-benchmark.github.io/