中文

基于稠密轨迹聚类的视频表示无监督学习

计算机视觉与模式识别 2020-06-30 v1

摘要

本文解决视频中动作识别表示的无监督学习任务。先前工作提出利用未来预测或其他领域特定目标来训练网络,但仅取得有限成功。相比之下,在相关的图像表示学习领域,更简单的基于判别的方法近期已弥合了与全监督性能之间的差距。我们首先提出将此类中两个表现最优的目标——实例识别与局部聚合——适配到视频领域。特别地,后一种方法在特征空间中迭代聚类视频并用非参数分类损失更新网络以尊重聚类。我们观察到有前景的性能,但定性分析显示所学表示未能捕捉运动模式,而是基于外观对视频分组。为缓解此问题,我们转向基于启发式的 IDT 描述子,其被手动设计为编码视频中的运动模式。我们在 IDT 空间中形成聚类,将这些描述子用作迭代局部聚合算法中的无监督先验。我们的实验表明该方法在 UCF101 和 HMDB51 动作识别基准上优于先前工作。我们还定性分析了所学表示,并显示它们成功捕捉了视频动态。

关键词

引用

@article{arxiv.2006.15731,
  title  = {Unsupervised Learning of Video Representations via Dense Trajectory Clustering},
  author = {Pavel Tokmakov and Martial Hebert and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2006.15731},
  year   = {2020}
}