中文

重新审视时间句定位中的视频采样与推理策略

计算机视觉与模式识别 2023-01-03 v1

摘要

时间句定位(TSG)旨在根据句子查询从未裁剪视频中识别特定片段的时间边界。所有现有工作首先利用稀疏采样策略提取固定数量的视频帧,然后与查询句进行多模态交互以推理。然而,我们认为这些方法忽略了两个不可或缺的问题:1) 边界偏差:标注的目标片段通常对应两特定帧作为起止时间戳。视频下采样过程可能丢失这两帧并将相邻无关帧作为新边界。2) 推理偏差:此类错误的新边界帧也导致帧-查询交互中的推理偏差,降低模型泛化能力。为缓解上述局限,本文提出一种新颖的孪生采样与推理网络(SSRN)用于TSG,其引入孪生采样机制生成额外上下文帧以丰富并精炼新边界。具体而言,设计了一种推理策略来学习这些帧间相互关系并为边界生成软标签,以实现更准确的帧-查询推理。该机制也能为采样的稀疏帧补充缺失的连续视觉语义,以进行细粒度活动理解。大量实验证明了SSRN在三个具挑战性数据集上的有效性。

关键词

引用

@article{arxiv.2301.00514,
  title  = {Rethinking the Video Sampling and Reasoning Strategies for Temporal Sentence Grounding},
  author = {Jiahao Zhu and Daizong Liu and Pan Zhou and Xing Di and Yu Cheng and Song Yang and Wenzheng Xu and Zichuan Xu and Yao Wan and Lichao Sun and Zeyu Xiong},
  journal= {arXiv preprint arXiv:2301.00514},
  year   = {2023}
}

备注

Accepted by EMNLP Findings, 2022