中文

基于大规模判别聚类的视频与文本学习

计算机视觉与模式识别 2017-07-31 v1

摘要

判别聚类已成功应用于许多弱监督学习任务,包括人与动作识别、文本到视频对齐、视频与图像中目标共分割与共定位。然而,判别聚类的一个缺陷是其有限的可扩展性。我们针对此问题,提出了一种基于块坐标Frank-Wolfe算法的在线优化算法。我们将所提方法应用于从电影及相应电影剧本中弱监督学习动作与演员的问题。将学习问题扩展到66部正片长度电影,使我们能够显著改进弱监督动作识别。

关键词

引用

@article{arxiv.1707.09074,
  title  = {Learning from Video and Text via Large-Scale Discriminative Clustering},
  author = {Antoine Miech and Jean-Baptiste Alayrac and Piotr Bojanowski and Ivan Laptev and Josef Sivic},
  journal= {arXiv preprint arXiv:1707.09074},
  year   = {2017}
}

备注

To appear in ICCV 2017