中文

G2L:基于测地线与博弈论的语义对齐且均匀分布的视频定位

计算机视觉与模式识别 2024-01-10 v4

摘要

近期的视频定位工作尝试将朴素对比学习引入视频定位。然而,我们指出这种朴素方案是次优的。对比学习需要两个关键性质:(1) 相似样本特征的\emph{对齐};(2) 归一化特征在超球面上诱导分布的\emph{均匀性}。由于视频定位中两个恼人问题:(1) 某些视觉实体在真值与其他时刻共存,即语义重叠;(2) 视频中仅少量时刻被标注,即稀疏标注困境,朴素对比学习无法建模时间上遥远时刻间的相关性,并学到不一致的视频表示。这两个特性导致朴素对比学习不适用于视频定位。本文引入测地线与博弈定位(Geodesic and Game Localization, G2L),一种通过测地线与博弈论的语义对齐且均匀的视频定位框架。我们利用测地线距离量化时刻间相关性,引导模型学习正确的跨模态表示。此外,从博弈论新视角,我们提出基于测地线距离采样的语义 Shapley 交互,以在相似时刻中学习细粒度语义对齐。在三个基准上的实验证明了方法的有效性。

关键词

引用

@article{arxiv.2307.14277,
  title  = {G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory},
  author = {Hongxiang Li and Meng Cao and Xuxin Cheng and Yaowei Li and Zhihong Zhu and Yuexian Zou},
  journal= {arXiv preprint arXiv:2307.14277},
  year   = {2024}
}

备注

ICCV2023 oral, release the code