中文

持续文本到视频检索中的帧融合与任务感知路由

计算机视觉与模式识别 2025-04-11 v2

摘要

文本到视频检索(TVR)旨在基于文本查询检索相关视频。然而,随着视频内容持续演化,使TVR系统适应新数据仍然是一个关键但尚未充分探索的挑战。在本文中,我们引入了持续文本到视频检索(CTVR)的首个基准,以解决现有方法的局限性。基于预训练模型(PTM)的TVR方法在适应新任务时难以保持模型可塑性,而现有的持续学习(CL)方法则遭受灾难性遗忘,导致历史查询与存储视频特征之间的语义不对齐。为了解决这两个挑战,我们提出了FrameFusionMoE,一种新型CTVR框架,包含两个关键组件:(1)帧融合适配器(FFA),在保持模型可塑性的同时捕获视频时间动态;(2)任务感知专家混合模型(TAME),确保跨任务的查询与存储视频特征之间保持一致的语义对齐。因此,FrameFusionMoE能够在处理连续视频流时有效适应新视频内容,同时保持历史文本-视频相关性以缓解灾难性遗忘。我们在两个基准数据集上全面评估了FrameFusionMoE,涵盖多种任务设置。结果表明,FrameFusionMoE优于现有的CL和TVR方法,在处理连续视频流时以最小退化实现了优越的检索性能。我们的代码可在https://github.com/JasonCodeMaker/CTVR获取。

关键词

引用

@article{arxiv.2503.10111,
  title  = {Continual Text-to-Video Retrieval with Frame Fusion and Task-Aware Routing},
  author = {Zecheng Zhao and Zhi Chen and Zi Huang and Shazia Sadiq and Tong Chen},
  journal= {arXiv preprint arXiv:2503.10111},
  year   = {2025}
}

备注

Accepted at SIGIR 2025