面向YouTube-8M视频理解挑战赛的受限尺寸Tensorflow模型
计算机视觉与模式识别
2018-11-12 v3
摘要
本文介绍了我们在第二届YouTube-8M视频理解竞赛中获得第七名的方案,该竞赛要求参赛者构建受限尺寸的模型,将数百万个YouTube视频分类为数千个类别。我们的最终模型由四个单一模型聚合为一个tensorflow计算图构成。对于每个单一模型,我们采用第一届YouTube-8M视频理解竞赛获胜方案中相同的网络架构,即门控NetVLAD。我们在tensorflow默认的float32精度下分别训练单一模型,随后将权重替换为float16精度,并在评估与推理阶段集成它们,实现了48.5%的压缩率且不损失精度。我们的最佳模型在私有排行榜上取得了88.324%的GAP。代码已公开于https://github.com/boliu61/youtube-8m。
引用
@article{arxiv.1808.06739,
title = {Constrained-size Tensorflow Models for YouTube-8M Video Understanding Challenge},
author = {Tianqi Liu and Bo Liu},
journal= {arXiv preprint arXiv:1808.06739},
year = {2018}
}
备注
Accepted paper at 2018 ECCV Youtube8M workshop: https://research.google.com/youtube8m/workshop2018/