中文

Concept-RuleNet:视觉语言模型中基于概念-规则的多智能体神经符号推理

计算机视觉与模式识别 2025-11-18 v1 人工智能 多智能体系统

摘要

现代视觉语言模型(VLMs)虽然在预测准确率方面表现突出,但对“为什么”做出决策几乎没有解释,尤其是在遇到离线分布数据时,经常会产生幻觉。神经符号框架通过将黑箱感知与可解释符号推理配对来缓解这一问题,但当前方法仅从任务标签中提取符号,导致符号缺乏对底层视觉数据的扎实 grounding。在本论文中,我们引入了一个多智能体系统—Concept-RuleNet,通过恢复视觉 grounding 同时保持透明的推理。具体而言,多模态概念生成器首先从代表性训练图像子集中挖掘判别性视觉概念。随后,这些视觉概念用于条件化符号发现,将生成锚定在真实图像统计数据上,从而缓解标签偏差。随后,符号由大型语言模型 reasoner 智能体生成可执行的一阶规则,yielding 可解释的神经符号规则。最后,在推理阶段,vision verifier 智能体量化每个符号的存在程度,并与黑箱神经模型的输出同步触发规则执行。在包括两个具有挑战性的医学影像任务和三个 underrepresented 自然图像数据集在内的五个基准测试上的实验表明,我们的系统在保持神经符号基线平均提升5%的同时,将规则中幻觉符号的发生率降低最高可达50%。

关键词

引用

@article{arxiv.2511.11751,
  title  = {Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models},
  author = {Sanchit Sinha and Guangzhi Xiong and Zhenghao He and Aidong Zhang},
  journal= {arXiv preprint arXiv:2511.11751},
  year   = {2025}
}

备注

AAAI 2026 (oral)