中文

视频活动定位中的跨句时序与语义关系

计算机视觉与模式识别 2021-08-19 v2

摘要

视频活动定位因其在自动定位与语言描述(句子)对应的最显著视觉片段方面的实用价值,近年来受到越来越多的关注。对于监督模型训练,必须给出每个句子对应视频片段(视频时刻)的开始和结束时间索引的时间标注。这不仅成本高昂,而且对歧义和主观标注偏差敏感,是一项比图像标注困难得多的任务。在这项工作中,我们通过引入跨句关系挖掘(CRM)来开发一种更精确的弱监督解决方案,该方法在仅有段落级别的活动描述而无逐句时间标注的情况下,用于视频时刻提案生成和匹配。具体来说,我们探索了两种跨句关系约束:(1)视频活动段落描述中句子间的时序顺序和(2)语义一致性。现有的弱监督技术仅在训练中考虑句内视频片段相关性,而忽略了跨句段落上下文。这可能会因单个句子表达模糊且与视觉上难以区分的视频时刻提案孤立匹配而产生误导。在两个公开的活动定位数据集上的实验表明,我们的方法优于最先进的弱监督方法,尤其是在视频活动描述变得更复杂时,优势更为明显。

关键词

引用

@article{arxiv.2107.11443,
  title  = {Cross-Sentence Temporal and Semantic Relations in Video Activity Localisation},
  author = {Jiabo Huang and Yang Liu and Shaogang Gong and Hailin Jin},
  journal= {arXiv preprint arXiv:2107.11443},
  year   = {2021}
}

备注

International Conference on Computer Vision (ICCV'21)