用于长时序视频理解的时间聚合表示
计算机视觉与模式识别
2020-08-03 v2
摘要
未来预测,尤其在长时序视频中,需要从当前与过去的观测进行推理。本工作中,我们借助灵活的多粒度时间聚合框架,探讨了时间范围、规模与语义抽象层级的问题。我们表明,利用最大池化与注意力等简单技术,即可在下一动作与密集预期上均达到最优性能(state of the art)。为展示模型的预期能力,我们在 Breakfast、50Salads 与 EPIC-Kitchens 数据集上开展实验,取得了最优结果。仅需极少修改,我们的模型亦可扩展至视频分割与动作识别。
引用
@article{arxiv.2006.00830,
title = {Temporal Aggregate Representations for Long-Range Video Understanding},
author = {Fadime Sener and Dipika Singhania and Angela Yao},
journal= {arXiv preprint arXiv:2006.00830},
year = {2020}
}
备注
ECCV 2020, European Conference on Computer Vision