MARQUIS:视频检索增强生成的三阶段管道
信息检索
2026-05-19 v1 计算机视觉与模式识别
摘要
从视频中进行检索增强生成需要系统从大型语料库中检索相关音视频证据并合成为连贯且可归因的文本。当前方法在两个方面都难以处理:检索方法在无法被单一嵌入捕获的复杂多层面查询上失败,而生成方法缺乏跨多个视频进行的高层次推理,且在处理长时间的多视频上下文时面临记忆限制。我们提出 MARQUIS:一个三阶段管道,通过 (1) 查询扩展、融合和重新排序、(2) 校准的结构化证据提取、以及 (3) 从提取的证据生成文章,可选由 RLM 控制。在 MAGMaR2026 shared task 上,我们将检索性能从 0.195 提升到 0.759(nDCG@10)。对于文章生成,ITER-QA-BASE 将平均人类得分从 3.09 提升到 3.83,MARQUIS-RLM 获得 3.30 的人类得分,并在非 QA 系统中实现最强的引用召回率。
引用
@article{arxiv.2605.17640,
title = {MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation},
author = {Debashish Chakraborty and Dengjia Zhang and Jialiang Jin and Hanting Liu and Katherine Guerrerio and Hanxiang Qin and Tyler Skow and Alexander Martin and Reno Kriz and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2605.17640},
year = {2026}
}
备注
Accepted as an oral presentation at the ACL 2026 Workshop MAGMaR Systems. 27 pages, 4 figures. Code can be found here: https://github.com/debashishc/marquis