PersuasiveToM:评估说服性对话中机器心智理论的基准
计算与语言
2025-05-27 v2
摘要
理解和预测自己及他人心理状态的能力被称为心智理论(ToM),这对于有效的社会场景至关重要。尽管最近的研究评估了大型语言模型(LLM)中的 ToM,但现有的基准侧重于简化的设置(例如 Sally-Anne 式任务),忽略了现实世界社会互动的复杂性。为了弥补这一差距,我们提出了 PersuasiveToM,这是一个旨在评估 LLM 在说服性对话中 ToM 能力的基准。我们的框架包含两个核心任务:ToM 推理,测试对不断演变的愿望、信念和意图的追踪;以及 ToM 应用,评估利用推断出的心理状态来预测和评估说服策略的能力。对八个领先 LLM 的实验表明,尽管模型在多个问题上表现出色,但它们在需要追踪心理状态动态和变化以及全面理解整个对话中心理状态的任务上仍然存在困难。我们希望通过 PersuasiveToM 能够有效地评估 LLM 的 ToM 推理能力,并更加关注复杂的心理活动。我们的代码可在 https://github.com/Yu-Fangxu/PersuasiveToM 获取。
引用
@article{arxiv.2502.21017,
title = {PersuasiveToM: A Benchmark for Evaluating Machine Theory of Mind in Persuasive Dialogues},
author = {Fangxu Yu and Lai Jiang and Shenyi Huang and Zhen Wu and Xinyu Dai},
journal= {arXiv preprint arXiv:2502.21017},
year = {2025}
}