中文

FastV-RAG:面向快速且细粒度视频问答的检索增强生成

计算机视觉与模式识别 2026-01-08 v2 人工智能

摘要

视觉语言模型(VLMs)在视觉推理方面表现出色,但仍在整合外部知识方面存在挑战。检索增强生成(RAG)是一种有前景的解决方案,但当前方法效率低下,常常难以维持高答案质量。为此,我们提出了VideoSpeculateRAG,一个基于轻量级VLM的RAG框架,建立在两个关键思想之上。首先,我们引入了一种推测解码流程:轻量级草稿模型快速生成多个答案候选,然后由更精确的重量级模型进行验证和细化,大幅减少推理延迟而不牺牲正确性。其次,我们识别到主要错误来源——检索到的知识中的实体识别不正确——并通过一种简单有效的基于相似度的过滤策略进行缓解,提高了实体对齐效果并提升了整体答案准确性。实验表明,VideoSpeculateRAG在准确率上与标准RAG方法相当或更高,同时将推理速度提高约2倍。该框架凸显了将推测解码与检索增强推理结合起来,以提高复杂知识密集型多模态任务效率和可靠性的潜力。

关键词

引用

@article{arxiv.2601.01513,
  title  = {FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation},
  author = {Gen Li and Peiyu Liu},
  journal= {arXiv preprint arXiv:2601.01513},
  year   = {2026}
}