观察者而非玩家:通过游戏观察模拟 LLM 的 Theory of Mind
人工智能
2025-12-23 v1
摘要
我们提出了一个用于评估大型语言模型(LLM)是否在简单而战略性的环境中展现出真正“理解”的交互式框架。作为一个案例,我们关注 Rock-Paper-Scissors(RPS),尽管该游戏看似简单,但需要顺序推理、调整和策略识别。我们的系统将 LLM 定位为观察者,其任务是识别正在使用的策略并阐述这种判断的推理依据。目的并非测试 LLM 对 Rock-Paper-Scissors 本身的了解,而是探讨模型是否能够对顺序行为展现类似心灵的推理。为支持系统评估,我们提供了一个基准,包含静态策略和由经过精心提示的规则指定的轻量级动态策略。我们量化了观察者的预测与由实际策略对组合产生的真实分布之间的对齐程度,使用三个互补信号:交叉熵、Brier 分数和期望值(EV)差异。这些指标进一步集成到统一的评分——Union Loss——中,该评分在校准、灵敏度和收益对齐之间进行平衡。除了 SIR(策略识别率)指标外,我们的框架不仅捕捉预测准确性,还捕捉模型是否能够稳定识别游戏中潜在策略的能力。该演示强调了交互性、透明性和可重复性。用户可以实时调整 LLM 分布,观察损失如何演变,直接检查推理片段,以识别故障发生的地方及其原因。通过这种方式,我们的系统为类似心灵的顺序游戏推理提供了一种实用且可解释的代理,洞察了当前 LLM 推理的优势与局限。
引用
@article{arxiv.2512.19210,
title = {Observer, Not Player: Simulating Theory of Mind in LLMs through Game Observation},
author = {Jerry Wang and Ting Yiu Liu},
journal= {arXiv preprint arXiv:2512.19210},
year = {2025}
}
备注
Accepted at NeurIPS Workshop on Foundations of Reasoning in Language Models and Workshop on Bridging Language, Agent, and World Model