中文

用于长时序视频理解的时间聚合表示

计算机视觉与模式识别 2020-08-03 v2

摘要

未来预测,尤其在长时序视频中,需要从当前与过去的观测进行推理。本工作中,我们借助灵活的多粒度时间聚合框架,探讨了时间范围、规模与语义抽象层级的问题。我们表明,利用最大池化与注意力等简单技术,即可在下一动作与密集预期上均达到最优性能(state of the art)。为展示模型的预期能力,我们在 Breakfast、50Salads 与 EPIC-Kitchens 数据集上开展实验,取得了最优结果。仅需极少修改,我们的模型亦可扩展至视频分割与动作识别。

关键词

引用

@article{arxiv.2006.00830,
  title  = {Temporal Aggregate Representations for Long-Range Video Understanding},
  author = {Fadime Sener and Dipika Singhania and Angela Yao},
  journal= {arXiv preprint arXiv:2006.00830},
  year   = {2020}
}

备注

ECCV 2020, European Conference on Computer Vision