语言模型能否理解物理概念?
计算与语言
2023-05-24 v1 计算机视觉与模式识别
摘要
语言模型(LMs)逐渐在交互式和具身世界中成为通用接口,而对物理概念的理解是其中的一项基本前提。然而,目前尚不清楚 LMs 能否理解人类世界中的物理概念。为探究此问题,我们设计了一个名为 VEC 的基准,涵盖以下任务:(i) 视觉概念,如物体的形状和材质;(ii) 具身概念,从与世界的互动中习得,如物体的温度。我们的零样本(少样本)提示结果表明,随着 LMs 规模扩大,对某些视觉概念的理解会浮现,但仍存在缩放定律不适用的基本概念。例如,OPT-175B 在材质概念上以 85% 的零样本准确率接近人类表现,却在质量概念上近乎随机猜测。相反,视觉增强的 LMs 如 CLIP 和 BLIP 实现了对人类水平的具身概念理解。分析表明,视觉表征中丰富的语义可作为具身知识的宝贵来源。受此启发,我们提出一种蒸馏方法,将具身知识从 VLMs 迁移到 LMs,取得了与将 LMs 参数规模扩大 134 倍相当的的性能提升。我们的数据集可在 \url{https://github.com/TobiasLee/VEC} 获取。
引用
@article{arxiv.2305.14057,
title = {Can Language Models Understand Physical Concepts?},
author = {Lei Li and Jingjing Xu and Qingxiu Dong and Ce Zheng and Qi Liu and Lingpeng Kong and Xu Sun},
journal= {arXiv preprint arXiv:2305.14057},
year = {2023}
}