中文

说谎者,说谎者,逻辑泥潭:大型语言模型假设推理的基准测试

计算与语言 2024-10-10 v2

摘要

骑士与无赖问题代表了一类经典的逻辑谜题,其中角色要么说真话,要么说谎。目标是根据每个角色的陈述逻辑推断其身份。挑战源于说真话或说谎的行为,这影响了每个陈述的逻辑含义。解决这些谜题不仅需要从单个陈述中进行直接推理,还需要通过推理各种假设场景来评估陈述的真实性。因此,骑士与无赖谜题是假设推理的引人注目的例子。在本文中,我们介绍了TruthQuest\textit{TruthQuest},一个基于骑士与无赖谜题原理的假设推理基准测试。我们的基准测试呈现了不同复杂程度的问题,同时考虑了角色数量和所涉及逻辑陈述的类型。在TruthQuest\textit{TruthQuest}上的评估表明,像Llama 3和Mixtral-8x7B这样的大型语言模型在解决这些任务时表现出显著困难。对模型输出的详细错误分析显示,性能较低的模型表现出多种推理错误,经常无法理解真话和谎言的概念。相比之下,更熟练的模型主要难以准确推断可能虚假陈述的逻辑含义。

关键词

引用

@article{arxiv.2406.12546,
  title  = {Liar, Liar, Logical Mire: A Benchmark for Suppositional Reasoning in Large Language Models},
  author = {Philipp Mondorf and Barbara Plank},
  journal= {arXiv preprint arXiv:2406.12546},
  year   = {2024}
}

备注

EMNLP 2024 main, 24 pages, 16 figures