中文

用于时间句子定位的变换等变一致性学习

计算机视觉与模式识别 2023-05-09 v1

摘要

本文研究时间句子定位(TSG)。尽管现有方法在该任务上已取得不错的成绩,但它们不仅严重依赖大量视频-查询配对数据进行训练,而且容易陷入数据集分布偏差。为缓解这些局限,我们引入一种新颖的等变一致性规约学习(ECRL)框架,以自监督方式为每个视频学习更具判别性的查询相关逐帧表示。我们的动机源于:在各类视频级变换下,查询引导活动的时序边界应被一致地预测。具体地,我们首先对前景和背景视频片段设计一系列时空增强以生成一组合成视频样本。特别地,我们设计了一个自精炼模块来增强增强后视频的完整性和平滑性。然后,我们提出一种应用于原始与增强视频的新型自监督一致性损失(SSCL),通过最小化两视频序列相似度与时刻距离先验高斯分布之间的 KL 散度,来捕捉其不变的查询相关语义。最后,引入一个共享定位头来预测原始与增强视频的变换等变查询引导片段边界。在三个具挑战性数据集(ActivityNet、TACoS 和 Charades-STA)上的大量实验证明了我们所提 ECRL 框架的有效性与高效性。

关键词

引用

@article{arxiv.2305.04123,
  title  = {Transform-Equivariant Consistency Learning for Temporal Sentence Grounding},
  author = {Daizong Liu and Xiaoye Qu and Jianfeng Dong and Pan Zhou and Zichuan Xu and Haozhao Wang and Xing Di and Weining Lu and Yu Cheng},
  journal= {arXiv preprint arXiv:2305.04123},
  year   = {2023}
}