中文

迈向平衡对齐:面向视频时刻检索的模态增强语义建模

计算机视觉与模式识别 2023-12-20 v1

摘要

Video Moment Retrieval (VMR) 旨在通过构建跨模态对齐策略,在未剪辑视频中检索与给定语言查询相对应的时间片段。然而,现有的这些策略通常不是最优的,因为它们忽略了模态不平衡问题,即视频中固有的语义丰富度远超给定有限长度句子的语义丰富度。因此,为了追求更好的对齐,一个自然的想法是增强视频模态以过滤掉与查询无关的语义,并增强文本模态以捕获更多与片段相关的知识。在本文中,我们引入了 Modal-Enhanced Semantic Modeling (MESM),这是一个通过在两个层次上增强特征来实现更平衡对齐的新颖框架。首先,我们通过词重建在帧-词层次上增强视频模态。该策略在帧级特征中强调与查询词相关的部分,同时抑制无关部分。因此,增强后的视频包含更少的冗余语义,并与文本模态更加平衡。其次,我们通过从上下文句子和真实片段中学习互补知识,在片段-句子层次上增强文本模态。随着这些知识被添加到查询中,文本模态从而保留了更有意义的语义,并与视频模态更加平衡。通过实现两个层次的 MESM,来自两种模态的语义信息在对齐时更加平衡,从而弥合了模态差距。在三个广泛使用的基准(包括分布外设置)上的实验表明,所提出的框架取得了新的 SOTA 性能,并具有显著的泛化能力(例如,在 Charades-STA 和 Charades-CG 上 [email protected] 分别平均提升 4.42% 和 7.69%)。代码将在 https://github.com/lntzm/MESM 提供。

关键词

引用

@article{arxiv.2312.12155,
  title  = {Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval},
  author = {Zhihang Liu and Jun Li and Hongtao Xie and Pandeng Li and Jiannan Ge and Sun-Ao Liu and Guoqing Jin},
  journal= {arXiv preprint arXiv:2312.12155},
  year   = {2023}
}

备注

Accepted to AAAI 2024