中文

面向LLM代理的经济决策基准测试与 litmus 测试

人工智能 2026-02-19 v4 计算与语言 计算机科学与博弈论

摘要

我们发展了评估方法,用于衡量LLM的经济决策能力和倾向。首先,我们从经济学中的关键问题(采购、调度和定价)中派生出基准测试,测试LLM在上下文环境中学习的能力。其次,我们发展了litmus测试框架,这是一套评估LLM在具有多个冲突目标的情境化决策任务上的选择行为的方法。每个litmus测试都会输出litmus得分,量化LLM的权衡响应;可靠性得分,衡量LLM选择行为的连贯性;以及专业能力得分,衡量LLM在将冲突目标替换为单一明确目标时在同一任务上的能力。评估广泛的前沿LLM后,我们(1)调查LLM能力和倾向随时间变化的情况,(2)从LLM的选择行为和链式思考中得出经济学上有意义的见解,(3)通过测试自我一致性、鲁棒性和可推广性来验证litmus测试框架的有效性。总体而言,本工作为LLM代理进一步集成到经济决策中提供了基础。

关键词

引用

@article{arxiv.2503.18825,
  title  = {EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents},
  author = {Sara Fish and Julia Shephard and Minkai Li and Ran I. Shorrer and Yannai A. Gonczarowski},
  journal= {arXiv preprint arXiv:2503.18825},
  year   = {2026}
}

备注

v3 was a major revision with updated experiments and analysis; v4 consists of minor edits