MADTempo:面向查询增强的多事件时序视频检索交互系统
计算机视觉与模式识别
2025-12-16 v1 人工智能
摘要
在线平台上视频内容的快速扩展加速了对检索系统的需求,这些系统不仅需要理解孤立的视觉时刻,还需要理解复杂事件的时间结构。现有方法在建模多个事件之间的时间依赖关系以及处理引用未见或罕见视觉概念的查询方面往往存在不足。为了解决这些挑战,我们引入了MADTempo,这是由我们的团队AIO_Trinh开发的视频检索框架,它将时序搜索与网络规模视觉锚定相统一。我们的时序搜索机制通过在连续视频片段上聚合相似度分数来捕捉事件级连续性,实现对多事件查询的连贯检索。此外,基于Google Image Search的回退模块通过外部网络图像扩展查询表示,有效弥合了预训练视觉嵌入中的差距,提高了对分布外(OOD)查询的鲁棒性。这些组件共同推进了现代视频检索系统的时间推理和泛化能力,为在大规模视频语料库中进行更语义感知和自适应检索铺平了道路。
引用
@article{arxiv.2512.12929,
title = {MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation},
author = {Huu-An Vu and Van-Khanh Mai and Trong-Tam Nguyen and Quang-Duc Dam and Tien-Huy Nguyen and Thanh-Huong Le},
journal= {arXiv preprint arXiv:2512.12929},
year = {2025}
}