情商检验!评估大型语言模型理性的基准测试
人工智能
2025-09-19 v1
摘要
大型语言模型(LLMs)是深度学习和机器智能领域的最新进展,展现出惊人的能力,被视为人工通用智能中最具前景的候选之一。凭借类人能力,LLMs被广泛用于模拟人类行为并作为AI助手服务于诸多应用。因此,人们越来越关心LLMs是否以及在何种情况下会像真实的人类智能体一样进行思考和行为。理性是评估人类行为的重要概念,既涉及思考方式(即理论理性),也涉及行动方式(即实践理性)。本文提出了首个评估LLMs全方位理性的基准测试,涵盖广泛的领域和各种LLMs。该基准包括易于使用的工具箱、详实的实验结果,并分析了LLMs在何处趋于理想化的人类理性,以及何处存在差异。我们认为,该基准可为LLMs的开发者和用户提供基础性工具。
引用
@article{arxiv.2509.14546,
title = {Rationality Check! Benchmarking the Rationality of Large Language Models},
author = {Zhilun Zhou and Jing Yi Wang and Nicholas Sukiennik and Chen Gao and Fengli Xu and Yong Li and James Evans},
journal= {arXiv preprint arXiv:2509.14546},
year = {2025}
}