中文

结合特征空间增强、学习到的标签关系与集成的大规模视频分类

计算机视觉与模式识别 2018-09-24 v1

摘要

本文介绍了 Axon AI 在第二届 YouTube-8M 视频理解挑战赛中的解决方案,在私有测试集上取得了 88.733% 的最终全局平均精度(GAP)(在 394 支队伍中排名第 3,未考虑模型大小约束),并使用满足大小要求的模型取得了 87.287%。分别训练了属于 3 个不同系列的 2 组各 7 个独立模型。随后,将这些多个模型在训练数据上的推理结果聚合,并用于训练一个满足模型大小要求的紧凑模型。为了进一步提升性能,我们探索并采用了特征空间中的数据过/欠采样、训练期间利用标签关系的额外正则化项,以及用于集成不同独立模型的学习权重。

关键词

引用

@article{arxiv.1809.07895,
  title  = {Large-Scale Video Classification with Feature Space Augmentation coupled with Learned Label Relations and Ensembling},
  author = {Choongyeun Cho and Benjamin Antin and Sanchit Arora and Shwan Ashrafi and Peilin Duan and Dang The Huynh and Lee James and Hang Tuan Nguyen and Mojtaba Solgi and Cuong Van Than},
  journal= {arXiv preprint arXiv:1809.07895},
  year   = {2018}
}