用于视频分类的多模态聚合
计算机视觉与模式识别
2017-10-31 v1
摘要
本文给出一种在大规模视频分类挑战赛(LSVC2017)[1]中获第一名的解决方案。我们聚焦于涵盖视觉、运动与音频的多种模态。同时,我们将聚合过程可视化以更好理解各模态如何发挥作用。在提取的模态中,我们发现由3D卷积计算的时间-空间特征颇具潜力,大幅提升了性能。我们凭借集成模型在测试集上取得了官方指标mAP 0.8741。
引用
@article{arxiv.1710.10330,
title = {Multi-modal Aggregation for Video Classification},
author = {Chen Chen and Xiaowei Zhao and Yang Liu},
journal= {arXiv preprint arXiv:1710.10330},
year = {2017}
}