中文

多模态大语言模型能否推理视觉说服?评估推理的有效性与忠实性

计算机视觉与模式识别 2026-05-12 v1

摘要

尽管多模态大语言模型(MLLM)在多模态任务上表现强劲,但预测图像是否具有说服力以及为何具有说服力仍然具有挑战性。我们首先表明,在预测前提示MLLM进行推理并不总是有帮助,甚至可能降低说服力预测性能,这表明朴素生成的推理依据对于此任务是不可靠的信号。然而,目前尚无成熟的方法论可用于训练MLLM推理视觉说服,或评估其推理依据是否忠实地支持其决策。为填补这一空白,我们通过实证和理论表明,在监督微调中使用多样化的教师生成推理依据可以提高视觉说服力预测。我们进一步引入了一个三维的忠实性评估框架,涵盖推理依据到决策的一致性、推理依据到图像的 groundedness 以及推理依据到决策的敏感性。应用该框架表明,仅凭预测性能并不能保证忠实的推理依据,而推理依据到决策的敏感性与人类对推理依据的偏好最为一致。这些发现激励了面向视觉说服力评估的忠实性感知训练目标和可扩展的推理依据监督。我们的代码和数据集将公开发布。

关键词

引用

@article{arxiv.2605.08965,
  title  = {Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning},
  author = {Naeun Lee and Hyunjong Kim and Sunghwan Choi and Injin Kong and Yohan Jo},
  journal= {arXiv preprint arXiv:2605.08965},
  year   = {2026}
}