中文

柠檬摊基准:评估大型语言模型在简单市场中的经济直觉

综合金融 2026-02-18 v1 人工智能

摘要

我们推出 LemonadeBench v0.5,一个用于评估大型语言模型 (LLM) 在简单市场中经济直觉、长期规划和不确定性决策能力的最小基准测试,通过模拟柠檬摊摊位商业模式进行测试。模型需管理具有保质期商品的库存、设定价格、选择营业时间,并在 30 天内实现利润最大化——这些都是任何小企业主每日面临的任务。所有模型均通过实现盈利而展现出有意义的经济行为,性能随模型复杂度提升呈指数级增长——从基础模型实现最低利润到前沿模型捕获 70% 的理论最优,提升超过 10 倍。然而,我们对商业效率在六个维度上的分解揭示了一致模式:模型实现的是局部而非全局优化,在特定领域表现出色,同时在其他方面表现出惊人的盲点。

关键词

引用

@article{arxiv.2602.13209,
  title  = {LemonadeBench: Evaluating the Economic Intuition of Large Language Models in Simple Markets},
  author = {Aidan Vyas},
  journal= {arXiv preprint arXiv:2602.13209},
  year   = {2026}
}