中文

NeXtVLAD:一种用于大规模视频分类中帧级特征聚合的高效神经网络

计算机视觉与模式识别 2018-11-14 v1

摘要

本文介绍了一种快速高效的网络架构NeXtVLAD,用于将帧级特征聚合为紧凑的特征向量以进行大规模视频分类。简言之,其基本思想是在沿时间应用NetVLAD聚合之前,通过注意力将高维特征分解为一组相对低维的向量。该NeXtVLAD方法在聚合时序信息方面既有效又参数高效。在第2届Youtube-8M视频理解挑战赛中,一个参数量小于80M的单一NeXtVLAD模型在私有排行榜上取得了0.87846的GAP分数。3个NeXtVLAD模型的混合取得了0.88722,在394支队伍中排名第3。代码已公开于https://github.com/linrongc/youtube-8m。

关键词

引用

@article{arxiv.1811.05014,
  title  = {NeXtVLAD: An Efficient Neural Network to Aggregate Frame-level Features for Large-scale Video Classification},
  author = {Rongcheng Lin and Jing Xiao and Jianping Fan},
  journal= {arXiv preprint arXiv:1811.05014},
  year   = {2018}
}

备注

ECCV 2018 workshop