多模态视频检索的智能路由:何时搜索何种信息
计算机视觉与模式识别
2025-07-21 v1 人工智能
信息检索
摘要
我们提出ModaRoute,一个基于LLM的智能路由系统,动态选择多模态视频检索的最优模态。虽然密集文本描述可实现75.9%的Recall@5,但需要昂贵的离线处理,且遗漏了34%含场景文本片段中不可被ASR捕获的关键视觉信息。通过分析查询意图并预测信息需求,ModaRoute在保持竞争力有效性(60.9% Recall@5)的同时,将计算开销降低41%。该方法使用GPT-4.1在ASR(语音)、OCR(文本)和视觉索引之间路由查询,平均每个查询使用1.78种模态,而非穷尽式的3.0种模态搜索。针对180万个视频片段的评估表明,智能路由为扩缩多模态检索系统提供了实用解决方案,在保持较低基础设施成本的同时,为实际部署维持了竞争力的检索效果。
引用
@article{arxiv.2507.13374,
title = {Smart Routing for Multimodal Video Retrieval: When to Search What},
author = {Kevin Dela Rosa},
journal= {arXiv preprint arXiv:2507.13374},
year = {2025}
}
备注
Accepted to ICCV 2025 Multimodal Representation and Retrieval Workshop