中文

视频打乱能否缓解时间偏差问题:一种用于时间定位的新训练框架

计算机视觉与模式识别 2022-08-08 v2

摘要

时间定位旨在未修剪视频中定位与给定句子查询语义对应的目标视频片段。然而,近期工作发现现有方法存在严重的时间偏差问题。这些方法并非基于视觉-文本语义对齐来推理目标片段位置,而是过度依赖训练集中查询的时间偏差。为此,本文提出一种用于定位模型的新训练框架,利用打乱视频解决时间偏差问题且不损失定位精度。我们的框架引入跨模态匹配和时间顺序判别两个辅助任务来促进定位模型训练。跨模态匹配任务利用打乱视频与原始视频间的内容一致性,迫使定位模型挖掘视觉内容以语义匹配查询。时间顺序判别任务利用时间顺序差异来加强对长期时间上下文的理解。在Charades-STA和ActivityNet Captions上的大量实验证明了我们的方法在缓解对时间偏差依赖及增强模型对不同时间分布泛化能力方面的有效性。代码见https://github.com/haojc/ShufflingVideosForTSG。

关键词

引用

@article{arxiv.2207.14698,
  title  = {Can Shuffling Video Benefit Temporal Bias Problem: A Novel Training Framework for Temporal Grounding},
  author = {Jiachang Hao and Haifeng Sun and Pengfei Ren and Jingyu Wang and Qi Qi and Jianxin Liao},
  journal= {arXiv preprint arXiv:2207.14698},
  year   = {2022}
}

备注

Accepted by ECCV2022