中文

MuSLR:多模态符号逻辑推理

计算机视觉与模式识别 2026-01-30 v2

摘要

多模态符号逻辑推理旨在通过形式逻辑从多模态输入中推导新事实,在自动驾驶和医疗诊断等高风险应用中至关重要,因为其严谨、确定性的推理有助于防止严重后果。为了评估当前最先进的视觉语言模型(VLMs)的此类能力,我们引入了首个基于形式逻辑规则的多模态符号逻辑推理基准 MuSLR。MuSLR 包含跨 7 个领域的 1,093 个实例,包括 35 种原子符号逻辑和 976 种逻辑组合,推理深度从 2 到 9 不等。我们在 MuSLR 上评估了 7 个最先进的 VLM,发现它们在多模态符号推理方面均存在困难,表现最好的模型 GPT-4.1 仅达到 46.8%。因此,我们提出 LogiCAM,一个将形式逻辑规则应用于多模态输入的模块化框架,使 GPT-4.1 的思维链性能提升了 14.13%,并在一阶逻辑等复杂逻辑上取得了更大的增益。我们还进行了全面的错误分析,表明约 70% 的失败源于模态间的逻辑错位,为指导未来改进提供了关键见解。所有数据和代码均公开于 https://llm-symbol.github.io/MuSLR。

关键词

引用

@article{arxiv.2509.25851,
  title  = {MuSLR: Multimodal Symbolic Logical Reasoning},
  author = {Jundong Xu and Hao Fei and Yuhui Zhang and Liangming Pan and Qijun Huang and Qian Liu and Preslav Nakov and Min-Yen Kan and William Yang Wang and Mong-Li Lee and Wynne Hsu},
  journal= {arXiv preprint arXiv:2509.25851},
  year   = {2026}
}

备注

Accepted by NeurIPS 2025