中文

穿越时间之旅:视频中活动的高效定位

计算机视觉与模式识别 2020-08-19 v5

摘要

通过语言查询在未裁剪视频中定位时刻是一项新颖且有趣的任务,需要具备将语言精确接地到视频的能力。以往工作处理该任务时通常对整段视频(往往多次)进行处理以定位相关活动。在此类方法的现实应用(如视频监控)中,效率是关键的系统需求。本文提出 TripNet,一种端到端系统,采用门控注意力架构对细粒度文本与视觉表征建模,以对齐文本与视频内容。此外,TripNet 利用强化学习,通过学习如何智能地在视频中跳跃,高效定位长视频中的相关活动片段。它仅提取少数帧的视觉特征来执行活动分类。在 Charades-STA、ActivityNet Captions 和 TACoS 数据集上的评估中,我们发现 TripNet 实现了高准确率,且仅观看整段视频的 32–41% 即节省了处理时间。

关键词

引用

@article{arxiv.1904.09936,
  title  = {Tripping through time: Efficient Localization of Activities in Videos},
  author = {Meera Hahn and Asim Kadav and James M. Rehg and Hans Peter Graf},
  journal= {arXiv preprint arXiv:1904.09936},
  year   = {2020}
}

备注

Presented at BMVC, 2020