中文

用于多模态大语言模型零样本任务的显式逻辑通道验证与增强

人工智能 2026-05-19 v2

摘要

前沿多模态大语言模型(Multimodal Large Language Models, MLLMs)在视觉语言理解(Visual-Language Comprehension, VLC)任务中展现出惊人的能力。然而,这些模型常以黑盒方式部署于新的任务中,缺乏可解释性。如何验证与理解这些模型的行为,对于将其应用于新任务尤为重要。我们提出一种显式逻辑通道(Explicit Logic Channel, ELC),它并行于黑箱模型通道,进行显式逻辑推理以实现模型的验证、选择与增强。这种前沿MLLM,内含潜在的视觉语言知识,可视为隐式逻辑通道(Implicit Logic Channel)。我们提出的显式逻辑通道模仿人类的逻辑推理过程,融合大型语言模型(LLM)、视觉特征模型(VFM)与概率推理,针对显式视觉证据进行事实推理、反事实推理与关系推理。我们提出一致性率(Consistency Rate, CR)用于跨通道验证与模型选择,即使没有 ground-truth标注亦可实现。此外,跨通道集成进一步提升了基于MLLM进行零样本任务中的表现,同时以显式视觉证据为依据,增强了可信度。我们在三个具有挑战性的基准上,对两个代表性VLC任务(即多选视觉问答,MC-VQA;和视觉问答式推荐,HC-REC)进行了全面实验,涵盖11个来自4个前沿家族的最新开源MLLM。我们的系统评估表明,所提出的ELC与CR在MLLM的验证、选择与改进方面均显示出效能,同时提升了可解释性与可信度。

关键词

引用

@article{arxiv.2603.11689,
  title  = {Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks},
  author = {Mei Chee Leong and Ying Gu and Hui Li Tan and Liyuan Li and Nancy Chen},
  journal= {arXiv preprint arXiv:2603.11689},
  year   = {2026}
}