中文

MERRIN:面向噪声网络环境中的多模态证据检索与推理基准

计算与语言 2026-04-16 v1 人工智能 计算机视觉与模式识别

摘要

受动自然语言查询的非明确性和多跳特性,以及真实网络结果的多模态、异构且常常冲突的本质所驱动,我们引入 MERRIN (Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments),一个人工标注的基准,用于评估搜索增强型智能体。MERRIN 测量 AI 智能体识别相关模态、检索多模态证据以及在噪声网络来源中执行多跳推理的能力。其与现有工作的区别体现在三个方面:(1) 使用不带显式模态线索的自然语言查询;(2) 包含视频和音频等较少探索的模态;(3) 需要在网络搜索期间检索复杂的、常常噪声或冲突的多模态证据。我们评估了由十个模型驱动的多样化搜索智能体,包括强大的闭源模型 (如 GPT-5.4-mini、Gemini 3/3.1 Flash/Pro) 和开源权重模型 (Qwen3-4B/30B/235B),在三个搜索设置下 (无搜索、原生搜索和智能体搜索)。我们的结果表明 MERRIN 极具挑战性:所有智能体的平均准确率仅为 22.3%,最佳表现者仅达 40.1%。我们进一步观察到,尽管像 Gemini Deep Research 这类更强大的智能体实现了更高的性能,但收益有限,因为过度探索;它们采取更多步骤、使用更多工具,但常被噪声或部分相关网络内容所分散,导致错误答案。与人类相比,这些智能体在资源消耗上更高,却获得更低的准确率,主要由于源选择效率低且过度依赖文本模态。这一发现凸显了在噪声网络环境中具备跨模态鲁棒搜索与推理能力的搜索智能体的必要性,使 MERRIN 成为评估此类能力的宝贵测试平台。

关键词

引用

@article{arxiv.2604.13418,
  title  = {MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments},
  author = {Han Wang and David Wan and Hyunji Lee and Thinh Pham and Mikaela Cankosyan and Weiyuan Chen and Elias Stengel-Eskin and Tu Vu and Mohit Bansal},
  journal= {arXiv preprint arXiv:2604.13418},
  year   = {2026}
}

备注

First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/