中文

面向多模态 LLM 的忠实优先推理、规划与行动

人工智能 2026-04-09 v4

摘要

多模态大语言模型(MLLMs)经常出现不忠实的问题,生成的推理链偏离视觉证据或与最终预测相矛盾。我们提出了忠实优先推理、规划与行动(RPA)框架,其中 FaithEvi 通过评估中间推理的忠实性提供逐步和链级别的监督,FaithAct 在推理过程中使用这些信号来规划并执行感知忠实性的行动。在多个多模态推理基准上的实验表明,与基于提示和工具增强的推理框架相比,忠实优先的 RPA 将感知忠实性提高了高达 24%,且未降低任务准确率。我们的分析表明,将忠实性作为指导原则可产生感知忠实的推理轨迹并减轻幻觉行为。因此,这项工作为评估和执行多模态推理中的忠实性建立了一个统一框架。代码位于 https://github.com/lijunxian111/Faithful-First-RPA。

关键词

引用

@article{arxiv.2511.08409,
  title  = {Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs},
  author = {Junxian Li and Xinyue Xu and Sai Ma and Di Zhang and Sichao Li},
  journal= {arXiv preprint arXiv:2511.08409},
  year   = {2026}
}

备注

Accepted by ACL 2026 Findings