SCSampler:从视频中采样显著片段以实现高效动作识别
计算机视觉与模式识别
2019-09-02 v2
摘要
尽管许多动作识别数据集由简短、裁剪过的视频集合组成,每个视频包含相关动作,但真实世界中的视频(例如 YouTube 上的)表现出非常不同的特性:它们通常长达数分钟,其中简短的相关片段常与长时间几乎无变化的片段交错。对此类视频中的每个时间片段密集地应用动作识别系统成本高得令人望而却步。此外,正如我们在实验中展示的,这会导致次优的识别精度,因为来自相关片段的有效预测被视频中长时间无信息区段产生的无意义分类输出所淹没。本文引入了一个轻量级的“片段采样”模型,可有效识别长视频中最显著的时间片段。我们证明,仅在这些最显著片段上调用识别,可大幅降低未裁剪视频上动作识别的计算成本。此外,我们表明,与对所有片段或随机/均匀选择片段进行分析相比,这带来了识别精度的显著提升。在 Sports1M 上,我们的片段采样方案将一个已是 state-of-the-art 的动作分类器的精度提升了 7%,并将其计算成本降低了 15 倍以上。
引用
@article{arxiv.1904.04289,
title = {SCSampler: Sampling Salient Clips from Video for Efficient Action Recognition},
author = {Bruno Korbar and Du Tran and Lorenzo Torresani},
journal= {arXiv preprint arXiv:1904.04289},
year = {2019}
}