中文

分层视频理解

计算机视觉与模式识别 2018-09-11 v1 机器学习 机器学习

摘要

我们提出了一种用于视频理解的分层架构,该架构通过在不同粒度级别上捕捉目标来利用真实世界动作的结构。我们设计的模型首先学习较简单的粗粒度任务,然后转而学习更细粒度的目标。模型以不同粒度级别上的联合损失进行训练。我们在近期发布的 Something-Something 数据集上展示了实证结果,该数据集提供了一组分层目标,即粗粒度动作组、细粒度动作类别和描述文本。实验表明,利用不同粒度级别目标的模型在所有级别上均取得了更好的性能。

关键词

引用

@article{arxiv.1809.03316,
  title  = {Hierarchical Video Understanding},
  author = {Farzaneh Mahdisoltani and Roland Memisevic and David Fleet},
  journal= {arXiv preprint arXiv:1809.03316},
  year   = {2018}
}