中文

多模态视频检索的智能路由:何时搜索何种信息

计算机视觉与模式识别 2025-07-21 v1 人工智能 信息检索

摘要

我们提出ModaRoute,一个基于LLM的智能路由系统,动态选择多模态视频检索的最优模态。虽然密集文本描述可实现75.9%的Recall@5,但需要昂贵的离线处理,且遗漏了34%含场景文本片段中不可被ASR捕获的关键视觉信息。通过分析查询意图并预测信息需求,ModaRoute在保持竞争力有效性(60.9% Recall@5)的同时,将计算开销降低41%。该方法使用GPT-4.1在ASR(语音)、OCR(文本)和视觉索引之间路由查询,平均每个查询使用1.78种模态,而非穷尽式的3.0种模态搜索。针对180万个视频片段的评估表明,智能路由为扩缩多模态检索系统提供了实用解决方案,在保持较低基础设施成本的同时,为实际部署维持了竞争力的检索效果。

关键词

引用

@article{arxiv.2507.13374,
  title  = {Smart Routing for Multimodal Video Retrieval: When to Search What},
  author = {Kevin Dela Rosa},
  journal= {arXiv preprint arXiv:2507.13374},
  year   = {2025}
}

备注

Accepted to ICCV 2025 Multimodal Representation and Retrieval Workshop