不同 AI 聊天机器人的行为表现如何?在行为经济学博弈中对大型语言模型进行基准测试
人工智能
2024-12-18 v1 计算与语言
摘要
将大型语言模型(LLM)部署到多样化的应用中,需要对其决策策略和行为模式有透彻的理解。作为近期一项关于行为图灵测试研究的补充,本文对五个领先的基于 LLM 的聊天机器人系列在一系列行为经济学博弈中的表现进行了全面分析。通过对这些 AI 聊天机器人进行基准测试,我们旨在揭示并记录它们在一系列场景中的共同和独特行为模式。研究结果为每个 LLM 的策略偏好提供了有价值的见解,突显了它们在关键决策角色中部署的潜在影响。
引用
@article{arxiv.2412.12362,
title = {How Different AI Chatbots Behave? Benchmarking Large Language Models in Behavioral Economics Games},
author = {Yutong Xie and Yiyao Liu and Zhuang Ma and Lin Shi and Xiyuan Wang and Walter Yuan and Matthew O. Jackson and Qiaozhu Mei},
journal= {arXiv preprint arXiv:2412.12362},
year = {2024}
}
备注
Presented at The First Workshop on AI Behavioral Science (AIBS 2024)