MotiveBench:我们离人类式动机推理还有多远?
计算与语言
2025-06-17 v1 人工智能
摘要
大型语言模型(LLM)已广泛用作各种场景(如社交模拟和AI伴侣)中智能体框架的核心。然而,它们是否能够复制人类的动机仍是一个备受关注的问题。现有基准受限于简单情景且缺乏角色身份,导致与真实情境之间存在信息不对称。为填补这一空白,本文提出MotiveBench,包含200个丰富情境情节和600个推理任务,覆盖动机的多个层次。使用MotiveBench,我们对七大主流模型家族进行了大规模实验,比较同一家族中不同规模和版本的模型。结果表明,即便是最先进的LLM在实现人类式动机推理方面仍不足。我们的分析揭示了若干关键发现,包括LLM在推理“爱与归属”动机方面仍面临困难,以及其倾向于过度理性化和理想化。这些洞见为LLM人性化的未来研究指明了方向。数据集、基准测试和代码已于 https://aka.ms/motivebench 提供。
引用
@article{arxiv.2506.13065,
title = {MotiveBench: How Far Are We From Human-Like Motivational Reasoning in Large Language Models?},
author = {Xixian Yong and Jianxun Lian and Xiaoyuan Yi and Xiao Zhou and Xing Xie},
journal= {arXiv preprint arXiv:2506.13065},
year = {2025}
}