中文

不可解问题检测:大型多模态模型的鲁棒理解评估

计算机视觉与模式识别 2025-06-10 v4 人工智能 计算与语言 机器学习

摘要

本文引入了一项新任务来评估大型多模态模型(LMM)的鲁棒理解能力,称为不可解问题检测(UPD)\textbf{不可解问题检测(UPD)}。多项选择问答(MCQA)被广泛用于评估LMM的理解能力,但它并不能保证LMM真正理解答案。UPD评估LMM在遇到MCQA的不可解问题时拒绝回答的能力,从而验证模型是否真正理解答案。UPD包含三个问题:缺失答案检测(AAD)、不兼容答案集检测(IASD)和不兼容视觉问题检测(IVQD),涵盖了答案缺失或选项不兼容以及图像-问题不匹配等不可解情况。为了进行评估,我们引入了MM-UPD基准,用于评估不同能力维度上的表现。我们的实验表明,即使是在现有基准上表现足够的大多数LMM,在MM-UPD上也面临显著困难,这突显了当前基准忽视的可信度新方面。详细分析表明,LMM存在不同的瓶颈,而思维链和自我反思改进了LLM能力存在瓶颈的LMM的性能。我们希望我们的见解能够增强对更可靠LMM的更广泛理解和开发。代码可在https://github.com/AtsuMiyai/UPD获取。

关键词

引用

@article{arxiv.2403.20331,
  title  = {Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models},
  author = {Atsuyuki Miyai and Jingkang Yang and Jingyang Zhang and Yifei Ming and Qing Yu and Go Irie and Yixuan Li and Hai Li and Ziwei Liu and Kiyoharu Aizawa},
  journal= {arXiv preprint arXiv:2403.20331},
  year   = {2025}
}

备注

Accepted by ACL 2025 Main Conference