中文

面向YouTube-8M视频理解挑战赛的受限尺寸Tensorflow模型

计算机视觉与模式识别 2018-11-12 v3

摘要

本文介绍了我们在第二届YouTube-8M视频理解竞赛中获得第七名的方案,该竞赛要求参赛者构建受限尺寸的模型,将数百万个YouTube视频分类为数千个类别。我们的最终模型由四个单一模型聚合为一个tensorflow计算图构成。对于每个单一模型,我们采用第一届YouTube-8M视频理解竞赛获胜方案中相同的网络架构,即门控NetVLAD。我们在tensorflow默认的float32精度下分别训练单一模型,随后将权重替换为float16精度,并在评估与推理阶段集成它们,实现了48.5%的压缩率且不损失精度。我们的最佳模型在私有排行榜上取得了88.324%的GAP。代码已公开于https://github.com/boliu61/youtube-8m。

关键词

引用

@article{arxiv.1808.06739,
  title  = {Constrained-size Tensorflow Models for YouTube-8M Video Understanding Challenge},
  author = {Tianqi Liu and Bo Liu},
  journal= {arXiv preprint arXiv:1808.06739},
  year   = {2018}
}

备注

Accepted paper at 2018 ECCV Youtube8M workshop: https://research.google.com/youtube8m/workshop2018/