中文

LLM 的随机鸭子现象:物理概念理解的综合评估

计算与语言 2025-02-14 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

我们以系统性方式探讨了一个广受关注的问题:LLM 是否真正理解它们所说的内容,这涉及更熟悉的术语“随机鸭子”。为此,我们提出了一个针对精心设计的物理概念理解任务(PhysiCo)的综合评估。该任务通过采用网格格式的输入来缓解记忆问题,这些输入抽象地描述了物理现象。网格代表从核心现象、应用示例到类比以及对其他抽象模式的理解的不同层次。对该任务的全面研究表明:(1) 最先进的 LLM 包括 GPT-4o、o1 和 Gemini 2.0 flash thinking 相较于人类落后约 40%;(2) 随机鸭子现象存在于 LLM 中,由于它们在网格任务中失败,但在自然语言中能良好描述和识别相同的概念;(3) 该任务之所以挑战 LLM,源于内在困难,而非不熟悉的网格格式,因为对相同格式数据的原地学习和微调对其性能贡献有限。

关键词

引用

@article{arxiv.2502.08946,
  title  = {The Stochastic Parrot on LLM's Shoulder: A Summative Assessment of Physical Concept Understanding},
  author = {Mo Yu and Lemao Liu and Junjie Wu and Tsz Ting Chung and Shunchi Zhang and Jiangnan Li and Dit-Yan Yeung and Jie Zhou},
  journal= {arXiv preprint arXiv:2502.08946},
  year   = {2025}
}

备注

NAACL 2025 Main Conference. First 5 authors contributed equally. Project page: https://physico-benchmark.github.io/