中文

探测 LLM 世界模型:运用智慧群体解码提升估算能力

人工智能 2025-09-27 v4 人机交互

摘要

估算——即对对象或事件进行粗略定量估计的技能——是常见的现实世界技能,却在大型语言模型(LLM)研究中受到忽视。我们引入三个估算数据集:MARBLES、FUTURE 和 ELECPRED,涵盖从物理估算(例如,多少颗橱灯装满一杯橱灯)到抽象预测(例如,2024 年美国总统大选结果)等任务。受社会科学中智慧群体(Wisdom of Crowds, WOC)概念的启发——即多次估计的中位数能提高准确性——我们提出了 WOC 解码方法用于 LLM。我们复制了人类参与者中的 WOC 效应,发现 LLM 也受益于类似效果:对抽样响应进行中位数聚合,始终比贪心解码、自洽解码和均值解码更准确。这表明 LLM 编码了支持近似推理的世界模型。我们的结果将估算定位为 LLM 世界知识的有用探针,并突显了 WOC 解码作为提升 LLM 估算在现实任务中表现的策略。

关键词

引用

@article{arxiv.2501.17310,
  title  = {Probing LLM World Models: Enhancing Guesstimation with Wisdom of Crowds Decoding},
  author = {Yun-Shiuan Chuang and Sameer Narendran and Nikunj Harlalka and Alexander Cheung and Sizhe Gao and Siddharth Suresh and Junjie Hu and Timothy T. Rogers},
  journal= {arXiv preprint arXiv:2501.17310},
  year   = {2025}
}