中文

用于视频时刻检索的逐帧跨模态匹配

计算机视觉与模式识别 2023-04-06 v2 多媒体

摘要

视频时刻检索旨在针对给定语言查询检索视频中的某一时刻。该任务的挑战包括:1)需要在未裁剪视频中定位相关时刻;2)弥合文本查询与视频内容之间的语义鸿沟。为解决这些问题,早期方法采用滑窗或均匀采样先收集视频片段,再将各片段与查询匹配。显然,这些策略耗时且常因黄金时刻长度不可预测而导致定位精度不佳。为避免上述局限,研究者近期尝试直接预测相关时刻边界,而无需先生成视频片段。一种主流方法是为目标查询与视频帧生成多模态特征向量(如拼接),然后基于该多模态特征向量使用回归方法检测边界。尽管此方法取得一定进展,我们认为其未能很好捕捉查询与视频帧间的跨模态交互。本文提出一种注意力跨模态相关性匹配(ACRM)模型,基于交互建模预测时间边界。此外,引入注意力模块为具有更丰富语义线索的查询词分配更高权重,这些词被认为对寻找相关视频内容更为重要。另一贡献是我们提出一个额外预测器,在模型训练中利用内部帧以提升定位精度。在TACoS与Charades-STA两个数据集上的大量实验证明了我们的方法优于若干SOTA方法。我们还进行了消融实验以检验ACRM模型中不同模块的有效性。

关键词

引用

@article{arxiv.2009.10434,
  title  = {Frame-wise Cross-modal Matching for Video Moment Retrieval},
  author = {Haoyu Tang and Jihua Zhu and Meng Liu and Zan Gao and Zhiyong Cheng},
  journal= {arXiv preprint arXiv:2009.10434},
  year   = {2023}
}

备注

12 pages; accepted by IEEE TMM