中文

不同思考者、一致基线:LLM-人类战略行为的有限理性解释

综合经济学 2026-05-27 v1 经济学

摘要

研究者开始在行为和政治科学实验中使用 LLM 代理,以替代人类受试者,常常是因为它们在实验室池中更便宜。这种替代在战略情境下并不成立:人类和 LLM 可靠地做出不同的选择,无论是精调人类响应数据还是人格条件,都未能缩小这一差距。行为经济学文献自 Simon 引入有限理性以来,已将人类战略行为建模为经典基线加上加法校正项 δ\delta。本文提出的框架将 δ\delta 解读为有限计算的数学签名:无限理性代理应计算的内容与实际计算的内容之间的差距。对于解决方案已存在于标准训练语料库中的经典游戏,LLM 通过检索和重组语料库材料来绕过产生 δ\delta 的限制。该框架可扩展至通过认知金字塔理论实现推理蒸馏的模型:它们可访问的 kk 级战略推理受计算预算和上下文长度限制,而非人类的认知约束,产生的 δ\delta(如果有的话)携带不同的结构特征。提出四项操作性检验(条件依赖、分布不对称、重复下的路径依赖性和改写鲁棒性),以区分人类形态的 δ\delta 与 LLM 形态的 δ\delta。预测者预计 δ|\delta| 会随着对等信号的 individuation 而增大,在命名对手与聚合对手设置之间,预计 Cohen's d0.5d \geq 0.5

关键词

引用

@article{arxiv.2605.26437,
  title  = {Divergent Minds, Convergent Baselines: A Bounded-Rationality Account of LLM-Human Strategic Behaviour},
  author = {Po Han Teo},
  journal= {arXiv preprint arXiv:2605.26437},
  year   = {2026}
}

备注

12 pages, 1 table, no figures. Theoretical prequel paper