中文

大型多模态模型能主动识别故障输入吗?输入审查能力的系统评估框架

计算机视觉与模式识别 2025-08-07 v1

摘要

大型多模态模型(Large Multimodal Models, LMMs)近年来取得了显著的进展,展现出在处理复杂多模态任务方面卓越性能的能力。近期研究强调,大型语言模型倾向于被动接受 defects 输入,常常在无效提示上进行徒劳的推理。然而,LMMs 是否能够主动检测和审查错误输入仍是一个未被探索的关键问题。为填补这一空白,我们引入了输入审查能力评估框架(Input Scrutiny Ability Evaluation Framework, ISEval),该框架涵盖七类错误前提和三个评估指标。对十个先进 LMMs 的广泛评估揭示了关键发现:大多数模型在无引导情况下难以主动检测错误文本前提,这反映出它们对显式提示进行前提错误识别具有强烈依赖。错误类型影响性能:模型在识别逻辑谬误方面表现突出,但在处理表层语言错误和某些条件性错误方面困难。不同模态的信任程度存在差异——Gemini 2.5 pro 和 Claude Sonnet 4 在视觉和文本信息之间取得了平衡,而 aya-vision-8b 在冲突情境下过度依赖文本信息。这些见解凸显了有助于增强 LMMs 主动验证输入有效性的紧迫需求,并为缓解该问题提供了新视角。代码已公开于 https://github.com/MLGroupJLU/LMM_ISEval。

关键词

引用

@article{arxiv.2508.04017,
  title  = {Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability},
  author = {Haiqi Yang and Jinzhe Li and Gengxu Li and Yi Chang and Yuan Wu},
  journal= {arXiv preprint arXiv:2508.04017},
  year   = {2025}
}

备注

9pages, 2figures