使用测试时增强的BERT大规模视频片段分类
计算机视觉与模式识别
2019-12-04 v1
摘要
本文介绍我们参加第三届YouTube-8M视频理解竞赛的方法,该竞赛要求参与者大规模地将视频级标签定位到标签实际出现的视频精确时间。我们的模型是帧级模型(如GatedNetVLAD和NeXtVLAD)与各种BERT模型及测试时增强的集成。我们探索多种聚合BERT输出作为视频表示的方法,以及多种融合视觉与音频信息的方式。我们提出测试时增强,即将视频帧向左或向右偏移一个单位,这为预测增添多样性并在评估指标上显示出经验性提升。我们首先在4M训练视频级数据上预训练模型,然后在237K标注视频片段级数据上微调。我们在私有测试视频片段数据上取得MAP@100K 0.7871,在283支队伍中排名第9。
引用
@article{arxiv.1912.01127,
title = {BERT for Large-scale Video Segment Classification with Test-time Augmentation},
author = {Tianqi Liu and Qizhan Shao},
journal= {arXiv preprint arXiv:1912.01127},
year = {2019}
}
备注
ICCV 2019 YouTube8M workshop