说谎者,说谎者,逻辑泥潭:大型语言模型假设推理的基准测试
计算与语言
2024-10-10 v2
摘要
骑士与无赖问题代表了一类经典的逻辑谜题,其中角色要么说真话,要么说谎。目标是根据每个角色的陈述逻辑推断其身份。挑战源于说真话或说谎的行为,这影响了每个陈述的逻辑含义。解决这些谜题不仅需要从单个陈述中进行直接推理,还需要通过推理各种假设场景来评估陈述的真实性。因此,骑士与无赖谜题是假设推理的引人注目的例子。在本文中,我们介绍了,一个基于骑士与无赖谜题原理的假设推理基准测试。我们的基准测试呈现了不同复杂程度的问题,同时考虑了角色数量和所涉及逻辑陈述的类型。在上的评估表明,像Llama 3和Mixtral-8x7B这样的大型语言模型在解决这些任务时表现出显著困难。对模型输出的详细错误分析显示,性能较低的模型表现出多种推理错误,经常无法理解真话和谎言的概念。相比之下,更熟练的模型主要难以准确推断可能虚假陈述的逻辑含义。
引用
@article{arxiv.2406.12546,
title = {Liar, Liar, Logical Mire: A Benchmark for Suppositional Reasoning in Large Language Models},
author = {Philipp Mondorf and Barbara Plank},
journal= {arXiv preprint arXiv:2406.12546},
year = {2024}
}
备注
EMNLP 2024 main, 24 pages, 16 figures