善用头部类:改进长尾视频识别
计算机视觉与模式识别
2023-04-04 v1
摘要
本文对长尾视频识别展开研究。我们表明,与自然采集的视频数据集及现有长尾图像基准不同,当前视频基准在多项长尾属性上存在不足。最关键在于,其尾部缺乏少样本类。对此,我们提出新的视频基准以更好评估长尾识别,方法是从SSv2与VideoLT两个数据集中采样子集。随后提出一种方法——长尾混合重构(Long-Tail Mixed Reconstruction, LMR),通过将少样本类实例重构为头部类样本的加权组合,减少对少样本类实例的过拟合。LMR进而采用标签混合学习鲁棒决策边界。其在EPIC-KITCHENS及所提出的SSv2-LT与VideoLT-LT上取得了最先进的平均类准确率。基准与代码见:tobyperrett.github.io/lmr
引用
@article{arxiv.2304.01143,
title = {Use Your Head: Improving Long-Tail Video Recognition},
author = {Toby Perrett and Saptarshi Sinha and Tilo Burghardt and Majid Mirmehdi and Dima Damen},
journal= {arXiv preprint arXiv:2304.01143},
year = {2023}
}
备注
CVPR 2023