中文

面向视频中时序语句定位的去偏

计算机视觉与模式识别 2021-11-09 v1 计算与语言

摘要

视频中的时序语句定位(TSGV)任务是从未裁剪视频中定位一个时序片段,以匹配语言查询(即句子)。若不考虑时刻标注中的偏差(如视频中的起始和结束位置),许多模型倾向于捕捉时刻标注的统计规律性,而不能很好地学习视频与语言查询之间的跨模态推理。本文提出两种去偏策略——数据去偏与模型去偏,以“迫使” TSGV 模型捕捉跨模态交互。数据去偏通过视频截断进行过采样,以平衡训练集中时刻的时间分布。模型去偏利用仅视频与仅查询模型捕捉分布偏差,并迫使模型学习跨模态交互。以 VSLNet 为基础模型,我们在两个包含分布外测试样本的数据集上评估了两种策略的影响。结果表明两种策略均能有效提升模型泛化能力。结合两种去偏策略后,VSLNet 在两个数据集上均取得最佳结果。

关键词

引用

@article{arxiv.2111.04321,
  title  = {Towards Debiasing Temporal Sentence Grounding in Video},
  author = {Hao Zhang and Aixin Sun and Wei Jing and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2111.04321},
  year   = {2021}
}

备注

13 pages, 6 figures, 11 tables