中文

细察视频时序语句定位:数据集与评测指标

计算机视觉与模式识别 2021-09-23 v3

摘要

视频时序语句定位(TSGV),即在长而未裁剪的视频序列中定位指示复杂人类活动的自然语言语句,在过去几年中受到了前所未有的关注。尽管每个新提出的方法看似都能取得优于以往方法的性能,当前的 TSGV 模型仍倾向于捕捉时刻标注偏差,且未能充分利用多模态输入。更令人难以置信的是,若干未经训练的极简基线也能取得最先进的性能。本文中,我们仔细审视现有的 TSGV 评测协议,发现主流的数据集划分与评测指标正是导致不可靠基准测试的根源。为此,我们提出重新组织两个广泛使用的 TSGV 基准(ActivityNet Captions 与 Charades-STA)。具体而言,我们刻意使训练集与测试集中真值时刻分布不同,即分布外(OOD)测试。同时,我们引入新的评测指标 dR@n,IoU@m,通过对受偏差影响的时刻预测进行惩罚来校准基本的 IoU 分数,并缓解由数据集标注偏差(如过长的真值时刻)引起的评测膨胀。在我们的新评测协议下,我们对八种最先进的 TSGV 方法进行了充分的实验与消融研究。所有结果均表明,重新组织的数据集划分与新指标能更好地监测 TSGV 领域的进展。我们重新组织的数据集可在 https://github.com/yytzsy/grounding_changing_distribution 获取。

关键词

引用

@article{arxiv.2101.09028,
  title  = {A Closer Look at Temporal Sentence Grounding in Videos: Dataset and Metric},
  author = {Yitian Yuan and Xiaohan Lan and Xin Wang and Long Chen and Zhi Wang and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2101.09028},
  year   = {2021}
}