中文

知晓聚焦之处:面向视频定位的事件感知 Transformer

计算机视觉与模式识别 2023-08-15 v1 机器学习

摘要

近期基于 DETR 的视频定位模型通过学习时刻查询,使模型直接预测时刻时间戳,而无需任何手工设计的组件,例如预定义候选框或非极大值抑制。然而,它们与输入无关的 moment queries 不可避免地忽略了视频固有的时间结构,提供的位置信息有限。在本文中,我们构建了一种事件感知的动态时刻查询,使模型能够考虑视频的输入特定内容与位置信息。为此,我们提出两个层次的推理:1) 事件推理,利用槽注意力机制捕获构成给定视频的独特事件单元;2) 时刻推理,通过门控融合 Transformer 层将时刻查询与给定句子融合,并学习时刻查询与视频-句子表示之间的交互以预测时刻时间戳。大量实验证明了事件感知动态时刻查询的有效性与高效性,在多个视频定位基准上优于最先进的方法。

关键词

引用

@article{arxiv.2308.06947,
  title  = {Knowing Where to Focus: Event-aware Transformer for Video Grounding},
  author = {Jinhyun Jang and Jungin Park and Jin Kim and Hyeongjun Kwon and Kwanghoon Sohn},
  journal= {arXiv preprint arXiv:2308.06947},
  year   = {2023}
}

备注

ICCV 2023. Code is available at https://github.com/jinhyunj/EaTR