中文

LLandMark:面向地标感知的多代理框架用于多模态交互式视频检索

计算机视觉与模式识别 2026-03-04 v1

摘要

日益增长的视频数据多样性和规模要求检索系统具备多模态理解、自适应推理和领域特定知识集成能力。本文提出 LLandMark,一个模块化的多代理框架,用于地标感知的多模态视频检索,以处理实际复杂查询。该框架包含四个阶段的专用代理协作:查询解析与规划、地标推理、多模态检索和重排序答案合成。关键组件——地标知识代理——检测文化或空间地标,并将其改写为描述性视觉提示,从而增强对越南场景的 CLIP 语义匹配。为扩展功能,我们引入一个由 LLM (Gemini 2.5 Flash) 辅助的图像到图像管道,其中大语言模型自主检测地标、生成图像搜索查询、检索代表性图像并执行 CLIP 视觉相似度匹配,无需手动输入图像。此外,利用 Gemini 和 LlamaIndex 的 OCR 精炼模块提高了越南文本识别。实验结果表明,LLandMark 实现了自适应、文化关联且可解释的检索性能。

关键词

引用

@article{arxiv.2603.02888,
  title  = {LLandMark: A Multi-Agent Framework for Landmark-Aware Multimodal Interactive Video Retrieval},
  author = {Minh-Chi Phung and Thien-Bao Le and Cam-Tu Tran-Thi and Thu-Dieu Nguyen-Thi and Vu-Hung Dao},
  journal= {arXiv preprint arXiv:2603.02888},
  year   = {2026}
}

备注

Accepted by AAAI 2026 Workshop on New Frontiers in Information Retrieval