中文

面向多模态RAG的多阶段验证中心框架

计算与语言 2026-01-21 v2 人工智能 信息检索

摘要

本文提出了团队CRUISE为KDD Cup 2025 Meta Comprehensive RAG Benchmark for Multi-modal, Multi-turn(CRAG-MM)挑战所开发的技术解决方案。该挑战旨在解决现代视觉语言模型(VLMs)的关键局限性:其倾向于在面对自恕式图像、长尾实体和复杂多跳问题时产生幻觉。这在用户提出需要高事实准确性的查询、跨模态场景中尤为问题。为此,我们提出了一个强大的多阶段框架,优先考虑事实准确性和真实性。该方案集成了轻量级查询路由器以提高效率,查询感知检索与摘要管道,双路径生成以及事后验证。这种保守策略旨在最小化幻觉,这在竞赛评分指标中将受到严厉惩罚。我们的方案在任务1中取得第三名,证明了在复杂多模态RAG系统中优先保证答案可靠性的有效性。我们的实现已公开于 https://github.com/Breezelled/KDD-Cup-2025-Meta-CRAG-MM。

关键词

引用

@article{arxiv.2507.20136,
  title  = {Multi-Stage Verification-Centric Framework for Mitigating Hallucination in Multi-Modal RAG},
  author = {Baiyu Chen and Wilson Wongso and Xiaoqian Hu and Yue Tan and Flora Salim},
  journal= {arXiv preprint arXiv:2507.20136},
  year   = {2026}
}

备注

KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task