分层视频理解
计算机视觉与模式识别
2018-09-11 v1 机器学习
机器学习
摘要
我们提出了一种用于视频理解的分层架构,该架构通过在不同粒度级别上捕捉目标来利用真实世界动作的结构。我们设计的模型首先学习较简单的粗粒度任务,然后转而学习更细粒度的目标。模型以不同粒度级别上的联合损失进行训练。我们在近期发布的 Something-Something 数据集上展示了实证结果,该数据集提供了一组分层目标,即粗粒度动作组、细粒度动作类别和描述文本。实验表明,利用不同粒度级别目标的模型在所有级别上均取得了更好的性能。
引用
@article{arxiv.1809.03316,
title = {Hierarchical Video Understanding},
author = {Farzaneh Mahdisoltani and Roland Memisevic and David Fleet},
journal= {arXiv preprint arXiv:1809.03316},
year = {2018}
}