NeXtVLAD:一种用于大规模视频分类中帧级特征聚合的高效神经网络
计算机视觉与模式识别
2018-11-14 v1
摘要
本文介绍了一种快速高效的网络架构NeXtVLAD,用于将帧级特征聚合为紧凑的特征向量以进行大规模视频分类。简言之,其基本思想是在沿时间应用NetVLAD聚合之前,通过注意力将高维特征分解为一组相对低维的向量。该NeXtVLAD方法在聚合时序信息方面既有效又参数高效。在第2届Youtube-8M视频理解挑战赛中,一个参数量小于80M的单一NeXtVLAD模型在私有排行榜上取得了0.87846的GAP分数。3个NeXtVLAD模型的混合取得了0.88722,在394支队伍中排名第3。代码已公开于https://github.com/linrongc/youtube-8m。
引用
@article{arxiv.1811.05014,
title = {NeXtVLAD: An Efficient Neural Network to Aggregate Frame-level Features for Large-scale Video Classification},
author = {Rongcheng Lin and Jing Xiao and Jianping Fan},
journal= {arXiv preprint arXiv:1811.05014},
year = {2018}
}
备注
ECCV 2018 workshop