中文

POSQA:以尺寸比较探查大语言模型的世界模型

计算与语言 2023-10-23 v1 人工智能 计算机与社会

摘要

具身语言理解强调语言理解不仅是大脑中的心理加工,还涉及与物理和社会环境的交互。随着大语言模型(LLMs)的爆发式增长及其在日常活动中的已然普及,验证其真实世界理解能力变得愈发必要。受认知理论启发,我们提出POSQA:一个物理对象尺寸问答数据集,包含简单的尺寸比较问题,用以检验最新LLMs具身理解的极限并分析其潜在机制。我们展示即便当今最大的LLMs在零样本设定下也表现不佳。随后我们通过先进提示技术与外部知识增强推及其极限。进一步,我们探究其真实世界理解主要源自上下文信息还是内部权重,并分析提示格式的影响及不同对象的报告偏差。结果表明,从文本数据塑形的LLMs的真实世界理解易被提示表层形式欺骗与混淆,从而与人类行为较不对齐。

关键词

引用

@article{arxiv.2310.13394,
  title  = {POSQA: Probe the World Models of LLMs with Size Comparisons},
  author = {Chang Shu and Jiuzhou Han and Fangyu Liu and Ehsan Shareghi and Nigel Collier},
  journal= {arXiv preprint arXiv:2310.13394},
  year   = {2023}
}

备注

Accepted by EMNLP 2023 Findings