NegotiationToM:用于检验机器理论心智迁移的谈判基准
计算与语言
2024-10-08 v3 人工智能
摘要
大型语言模型(LLMs)引发了关于其 Theory of Mind(ToM)能力潜在出现的广泛兴趣和争议。当前的 ToM 评估侧重于使用机器生成数据或游戏设置进行测试,这些设置容易产生捷径和伪相关,缺乏对机器 ToM 在真实人类交互场景中的评估。这构成了开发新真实场景基准的迫切需求。我们引入 NegotiationToM,一个新的基准,旨在对机器在真实谈判情境中的 ToM 进行压力测试,涵盖多维心理状态(即欲望、信念和意图)。本基准基于 Belief-Desire-Intention(BDI)智能体建模理论,开展了必要的实证实验以评估大型语言模型。我们的发现表明,NegotiationToM 对最先进的 LLMs 具有挑战性,因为即使采用链式思维(CoT)方法,模型的表现也显著低于人类。
引用
@article{arxiv.2404.13627,
title = {NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surrounding},
author = {Chunkit Chan and Cheng Jiayang and Yauwai Yim and Zheye Deng and Wei Fan and Haoran Li and Xin Liu and Hongming Zhang and Weiqi Wang and Yangqiu Song},
journal= {arXiv preprint arXiv:2404.13627},
year = {2024}
}
备注
Accepted to EMNLP 2024 findings. Dataset: https://github.com/HKUST-KnowComp/NegotiationToM