CRAG-MM:面向多模态多轮对话的综合性 RAG 基准
计算机视觉与模式识别
2025-10-31 v1
摘要
智能眼镜等可穿戴设备正在改变人们与周围环境交互的方式,使用户能够就其视野中的实体寻求信息。多模态检索增强生成(MM-RAG)在支持此类问题方面发挥着关键作用,但目前尚无针对此任务的综合基准,尤其是针对可穿戴场景。为填补这一空白,我们提出CRAG-MM——一个面向多模态多轮对话的综合性 RAG 基准。CRAG-MM包含6.5K个(图像、问题、答案)三元组和2K个基于视觉的多轮对话,涵盖13个领域,其中6.2K个仰卧位图像旨在模拟来自可穿戴设备的捕获。我们仔细构建问题,以反映真实场景和挑战,包括五类图像质量问题、六类问题类型、不同实体流行度、不同的信息动态性以及不同的对话轮次。我们设计了三个任务:单源增强、多源增强和多轮对话——每个任务都配有相应的检索语料库和API,支持图像-KG 检索和网页检索。我们的评估显示,简单直接的 RAG 方法在CRAG-MM单轮和多轮 QA中的可信度分别仅为32%和43%,而最先进的行业解决方案质量相似(32%/45%),凸显了仍有广阔的提升空间。该基准已举办KDD Cup 2025,吸引约1K名参赛者和5K篇提交作品,获胜方案将基线性能提升了28%,凸显其在推动领域发展中的早期影响。
引用
@article{arxiv.2510.26160,
title = {CRAG-MM: Multi-modal Multi-turn Comprehensive RAG Benchmark},
author = {Jiaqi Wang and Xiao Yang and Kai Sun and Parth Suresh and Sanat Sharma and Adam Czyzewski and Derek Andersen and Surya Appini and Arkav Banerjee and Sajal Choudhary and Shervin Ghasemlou and Ziqiang Guan and Akil Iyer and Haidar Khan and Lingkun Kong and Roy Luo and Tiffany Ma and Zhen Qiao and David Tran and Wenfang Xu and Skyler Yeatman and Chen Zhou and Gunveer Gujral and Yinglong Xia and Shane Moon and Nicolas Scheffer and Nirav Shah and Eun Chang and Yue Liu and Florian Metze and Tammy Stark and Zhaleh Feizollahi and Andrea Jessee and Mangesh Pujari and Ahmed Aly and Babak Damavandi and Rakesh Wanga and Anuj Kumar and Rohit Patel and Wen-tau Yih and Xin Luna Dong},
journal= {arXiv preprint arXiv:2510.26160},
year = {2025}
}