中文

LLM在语言多样化文本中的逻辑推理稳定性:形式逻辑翻译器实验

计算与语言 2026-02-02 v3

摘要

大型语言模型(LLM)的逻辑推理受到日益关注的注意。主流方法之一是将自然语言翻译成形式逻辑,然后应用符号求解器进行推理。虽然在许多任务中有效,但这些LLM-based翻译器往往无法在同一概念以不同语言形式出现时生成一致的符号表示。此类不一致会破坏逻辑一致性并导致求解器错误。然而,大多数现有基准缺乏这种语言多样性,而这种多样性在现实文本中经常发生,使问题性质未得到充分探讨。为填补这一空白,我们提出SoLT——一个系统性地将推理数据集重写为多种多样且在逻辑上等价形式的基准。除了评估之外,SoLT还为任何数据集提供一种通用方法,通过保持意义和逻辑的同时,为其注入语言多样性。为进一步提升LLM-based翻译器的稳定性,我们提出MenTaL,通过在翻译过程中显式引导模型构建概念-符号映射表。通过将等效表达式链接到共享符号,MenTaL可保持一致性并减缓符号漂移。在SoLT上的实验表明,LLM确实会在语言多样性导致符号映射不一致,从而显著降低推理准确率。相比之下,应用MenTaL可在多样化输入上实现明显且稳定的性能提升。总体而言,我们的发现揭示了忽视语言多样性掩盖了LLM-based翻译器关键弱点的因素,我们的工作为在多变的真实场景中实现更可靠的逻辑推理提供了一步步伐。我们的代码可在https://github.com/wufeiwuwoshihua/LinguDiver获取。

关键词

引用

@article{arxiv.2506.04575,
  title  = {Are LLMs Stable Formal Logic Translators in Logical Reasoning Across Linguistically Diversified Texts?},
  author = {Qingchuan Li and Jiatong Li and Zirui Liu and Mingyue Cheng and Yuting Zeng and Qi Liu and Tongxuan Liu},
  journal= {arXiv preprint arXiv:2506.04575},
  year   = {2026}
}

备注

Accepted by WWW2026