中文

用于视频时刻检索和突出显示的多模态融合与查询细化网络

计算机视觉与模式识别 2025-01-22 v1

摘要

给定视频和语言查询,视频时刻检索和突出显示(MR&HD)旨在定位所有相关时段,同时预测显著性得分。大多数现有方法仅使用 RGB 图像作为输入,忽略了如光流和深度等内在的多模态视觉信号。本文提出了一种多模态融合与查询细化网络(MRNet),用于学习来自多模态线索的互补信息。具体而言,我们设计了多模态融合模块,以动态方式组合 RGB、光流和深度图。此外,为模拟人类对句子的理解,我们引入查询细化模块,该模块在单词、短语和句子层面合并文本。针对 QVHighlights 和 Charades 数据集进行的全面实验表明,MRNet 在 MR-mAP@Avg 上优于当前最先进方法提升了 +3.41,在 HD-HIT@1 上提升了 +3.46。

关键词

引用

@article{arxiv.2501.10692,
  title  = {Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection},
  author = {Yifang Xu and Yunzhuo Sun and Benxiang Zhai and Zien Xie and Youyao Jia and Sidan Du},
  journal= {arXiv preprint arXiv:2501.10692},
  year   = {2025}
}

备注

Accepted by ICME 2024