探测 LLM 世界模型:运用智慧群体解码提升估算能力
人工智能
2025-09-27 v4 人机交互
摘要
估算——即对对象或事件进行粗略定量估计的技能——是常见的现实世界技能,却在大型语言模型(LLM)研究中受到忽视。我们引入三个估算数据集:MARBLES、FUTURE 和 ELECPRED,涵盖从物理估算(例如,多少颗橱灯装满一杯橱灯)到抽象预测(例如,2024 年美国总统大选结果)等任务。受社会科学中智慧群体(Wisdom of Crowds, WOC)概念的启发——即多次估计的中位数能提高准确性——我们提出了 WOC 解码方法用于 LLM。我们复制了人类参与者中的 WOC 效应,发现 LLM 也受益于类似效果:对抽样响应进行中位数聚合,始终比贪心解码、自洽解码和均值解码更准确。这表明 LLM 编码了支持近似推理的世界模型。我们的结果将估算定位为 LLM 世界知识的有用探针,并突显了 WOC 解码作为提升 LLM 估算在现实任务中表现的策略。
引用
@article{arxiv.2501.17310,
title = {Probing LLM World Models: Enhancing Guesstimation with Wisdom of Crowds Decoding},
author = {Yun-Shiuan Chuang and Sameer Narendran and Nikunj Harlalka and Alexander Cheung and Sizhe Gao and Siddharth Suresh and Junjie Hu and Timothy T. Rogers},
journal= {arXiv preprint arXiv:2501.17310},
year = {2025}
}