观点是我的,也是你的:基于共同基础的心理理论基准测试
计算与语言
2024-06-11 v2
摘要
评估语言模型的心理理论能力最近受到了广泛关注。然而,许多现有的基准测试依赖于合成数据,这可能导致实验结果与人类行为不一致。我们引入了第一个基于自然发生的口语对话的心理理论数据集Common-ToM,并表明语言模型在展示心理理论方面存在困难。然后,我们证明,整合一个简单、显式的信念表示可以提高语言模型在Common-ToM上的性能。
引用
@article{arxiv.2403.02451,
title = {Views Are My Own, but Also Yours: Benchmarking Theory of Mind Using Common Ground},
author = {Adil Soubki and John Murzaku and Arash Yousefi Jordehi and Peter Zeng and Magdalena Markowska and Seyed Abolghasem Mirroshandel and Owen Rambow},
journal= {arXiv preprint arXiv:2403.02451},
year = {2024}
}