STEER:评估大型语言模型的经济理性
计算与语言
2024-05-29 v2 综合经济学
经济学
摘要
越来越多的人有兴趣将LLM用作决策“代理”。这涉及许多自由度:应使用哪个模型;应如何提示;是否应要求其内省、进行思维链推理等?解决这些问题——以及更广泛地,确定LLM代理是否足够可靠以值得信任——需要一种评估此类代理经济理性的方法论。本文提供了这样一种方法论。我们首先调查了关于理性决策的经济学文献,对代理应表现出的大量细粒度“要素”及其依赖关系进行了分类。然后,我们提出了一个基准分布,定量评分LLM在这些要素上的表现,并结合用户提供的评分标准,生成“STEER报告卡”。最后,我们描述了一项包含14个不同LLM的大规模实证实验结果,刻画了当前最先进水平以及不同模型大小对模型展现理性行为能力的影响。
引用
@article{arxiv.2402.09552,
title = {STEER: Assessing the Economic Rationality of Large Language Models},
author = {Narun Raman and Taylor Lundy and Samuel Amouyal and Yoav Levine and Kevin Leyton-Brown and Moshe Tennenholtz},
journal= {arXiv preprint arXiv:2402.09552},
year = {2024}
}