VideoLT:大规模长尾视频识别
计算机视觉与模式识别
2021-08-19 v3
摘要
现实世界中的标签分布往往是长尾且不平衡的,导致模型偏向主导标签。虽然长尾识别已在图像分类任务中得到广泛研究,但在视频领域所做的努力有限。在本文中,我们引入 VideoLT,一个大规模长尾视频识别数据集,作为迈向真实世界视频识别的一步。我们的 VideoLT 包含 256,218 个未裁剪视频,标注为 1,004 个类别,呈长尾分布。通过广泛研究,我们证明用于长尾图像识别的先进方法在视频领域表现不佳,原因在于视频数据额外的时序维度。这促使我们提出 FrameStack,一种简单而有效的长尾视频识别任务方法。特别地,FrameStack 在帧级别进行采样以平衡类别分布,且采样比由训练期间从网络导出的知识动态确定。实验结果表明 FrameStack 可在不牺牲总体准确率的情况下提升分类性能。代码与数据集可在 https://github.com/17Skye17/VideoLT 获取。
引用
@article{arxiv.2105.02668,
title = {VideoLT: Large-scale Long-tailed Video Recognition},
author = {Xing Zhang and Zuxuan Wu and Zejia Weng and Huazhu Fu and Jingjing Chen and Yu-Gang Jiang and Larry Davis},
journal= {arXiv preprint arXiv:2105.02668},
year = {2021}
}
备注
To appear in ICCV 2021