ARK:基于推理与知识的双轴多模态检索基准
计算机视觉与模式识别
2026-02-11 v1
摘要
现有的多模态检索基准主要侧重日常生活图像上的语义匹配,且对专业知识和复杂推理诊断能力有限。为此,我们提出ARK基准,旨在从两个互补的视角分析多模态检索:(i) 知识领域(涵盖五大领域、十七个子类型),刻画内容及检索所依赖的专业知识;(ii) 推理技能(涵盖六大类别),刻画识别正确候选答案所需对多模态证据进行的推理类型。具体而言,ARK评估包含单模态和多模态查询与候选,覆盖十六种异构视觉数据类型。为避免评估中的捷径匹配,大多数查询配以针对性硬负例,要求多步推理。我们在ARK上评估了二十三个代表性文本基和多模态检索器,发现知识密集型检索与推理密集型检索之间存在显著差距,细粒度视觉与空间推理始终是瓶颈。我们进一步表明,简单增强如重排序和改写可带来持续性改进,但仍有显著提升空间。
引用
@article{arxiv.2602.09839,
title = {ARK: A Dual-Axis Multimodal Retrieval Benchmark along Reasoning and Knowledge},
author = {Yijie Lin and Guofeng Ding and Haochen Zhou and Haobin Li and Mouxing Yang and Xi Peng},
journal= {arXiv preprint arXiv:2602.09839},
year = {2026}
}