中文

GMMFormer v2:面向部分相关视频检索的不确定性感知框架

计算机视觉与模式识别 2024-05-24 v1

摘要

给定文本查询,部分相关视频检索(PRVR)旨在检索包含相关时刻的未裁剪视频。由于缺乏时刻标注,clip 模型和文本-clip 对应关系中的不确定性导致了主要挑战。尽管取得了显著进展,现有方法要么牺牲效率,要么牺牲效果来捕捉变化且不确定的视频时刻。更糟糕的是,很少有方法关注此类不确定性下的文本-clip 匹配模式,这暴露了语义坍塌的风险。为解决这些问题,我们提出了 GMMFormer v2,一个用于 PRVR 的不确定性感知框架。对于 clip 模型,我们在多尺度上下文特征上增强了强基线 GMMFormer,引入了新的时序整合模块,既保持了效率,又提高了对变化时刻的感知能力。为实现不确定性感知的文本-clip 匹配,我们将 GMMFormer 中的查询多样化损失升级为促进细粒度均匀性,并提出一种新的最优匹配损失,用于细粒度文本-clip 对齐。它们的协同作用缓解了语义坍塌现象,并显著提升了文本与时刻之间的准确对应。我们在三个 PRVR 数据集上进行了大量实验和消融研究,表明 GMMFormer v2 在相较过去 SOTA 竞争者和不确定性感知文本-clip 匹配在 PRVR 中的多样性方面都有显著提升。代码已公开 \url{https://github.com/huangmozhi9527/GMMFormer_v2}。

关键词

引用

@article{arxiv.2405.13824,
  title  = {GMMFormer v2: An Uncertainty-aware Framework for Partially Relevant Video Retrieval},
  author = {Yuting Wang and Jinpeng Wang and Bin Chen and Tao Dai and Ruisheng Luo and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2405.13824},
  year   = {2024}
}