中文

UniToMBench:整合视角采信以提升 LLM 的心智理论

计算与语言 2025-06-12 v1 人工智能

摘要

心智理论(ToM)是理解自身和他人心理状态的能力,对于大语言模型(LLMs)而言仍是一个具有挑战性的领域,因为 LLMs 往往无法准确预测人类的心理状态。在本文中,我们提出了 UniToMBench,一个统一的基准测试,通过整合多交互任务设计和演进的故事场景,结合 SimToM 和 TOMBENCH 的优势,系统性地提升和评估 LLMs 的心智理论能力。该基准由超过 1,000 个手写场景的自定义数据集支持,将视角采信技术与多样化的评估指标相结合,以更好地激发 LLMs 的社会认知。通过评估,我们观察到 GPT-4o 和 GPT-4o Mini 等模型在涉及情感和信念相关场景的任务中表现出持续的高准确率(通常在 80% 以上),但在基于知识的任务中性能存在显著差异。这些结果揭示了当前 LLMs 在心智理论相关任务中的优势与局限性,凸显了 UniToMBench 作为未来开发综合工具的价值。我们的代码公开可获取:https://github.com/Shamant/unifiedtombenchmark。

关键词

引用

@article{arxiv.2506.09450,
  title  = {UniToMBench: Integrating Perspective-Taking to Improve Theory of Mind in LLMs},
  author = {Prameshwar Thiyagarajan and Vaishnavi Parimi and Shamant Sai and Soumil Garg and Zhangir Meirbek and Nitin Yarlagadda and Kevin Zhu and Chris Kim},
  journal= {arXiv preprint arXiv:2506.09450},
  year   = {2025}
}

备注

Accepted at Conference of the North American Chapter of the Association for Computational Linguistics, Student Research Workshop 2025 (NAACL SRW 2025)