离散世界模型的理论心智复杂度度量
人工智能
2024-10-10 v3 计算与语言
机器学习
摘要
理论心智(Theory of Mind, ToM)可用于评估大型语言模型(Large Language Models, LLMs)在需要社会推理的复杂情境中的能力。尽管研究社区提出了许多ToM基准测试,但其难度差异很大,复杂度未得到良好定义。本工作提出一种受认知负荷理论启发的框架,用于衡量ToM任务的复杂度。我们将问题的复杂度量化为正确解决该问题所需的状态数量。我们的复杂度度量还考虑了旨在使其看起来更难的ToM问题的虚假状态。我们使用该方法评估了五个广泛采用的ToM基准测试的复杂度。在该框架之上,我们设计了一种提示技术,通过描述代理交互如何导致环境变化来扩展模型可用信息。我们称该技术为离散世界模型(Discrete World Models, DWM),并展示了其如何在ToM任务中激发出优异性能。
引用
@article{arxiv.2406.11911,
title = {A Notion of Complexity for Theory of Mind via Discrete World Models},
author = {X. Angelo Huang and Emanuele La Malfa and Samuele Marro and Andrea Asperti and Anthony Cohn and Michael Wooldridge},
journal= {arXiv preprint arXiv:2406.11911},
year = {2024}
}
备注
Accepted EMNLP 2024, Website https://flecart.github.io/complexity-tom-dwm