中文

Seek-and-Solve:日常场景中基于视觉线索推理的多模态大语言模型基准测试

计算机视觉与模式识别 2026-04-17 v2

摘要

日常场景以视觉丰富性为特征,要求多模态大语言模型(MLLMs)过滤噪声并识别决定性的视觉线索以进行准确推理。然而,当前的基准测试主要旨在评估MLLMs的既有知识或感知理解,往往忽略了关键的推理能力。为弥补这一空白,我们引入了DailyClue,一个专为日常场景中基于视觉线索推理而设计的基准测试。我们的构建遵循两个核心原则:(1)严格基于真实的日常活动;(2)具有挑战性的查询设计,需要超越表面感知。我们的问题并非简单的识别,而是迫使MLLMs主动探索合适的视觉线索并利用它们进行后续推理。为此,我们整理了一个涵盖四个主要日常领域和16个不同子任务的综合数据集。对MLLMs和智能体模型的全面评估凸显了我们基准测试所带来的巨大挑战。我们的分析揭示了几个关键见解,强调准确识别视觉线索对于稳健推理至关重要。

关键词

引用

@article{arxiv.2604.14041,
  title  = {Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios},
  author = {Xiaomin Li and Tala Wang and Zichen Zhong and Ying Zhang and Zirui Zheng and Takashi Isobe and Dezhuang Li and Huchuan Lu and You He and Xu Jia},
  journal= {arXiv preprint arXiv:2604.14041},
  year   = {2026}
}

备注

Accepted by ACL Findings 2026. Project page: https://xiaominli1020.github.io/DailyClue/