中文

面向高效视频分类的深度无监督关键帧提取

计算机视觉与模式识别 2022-11-15 v1 人工智能

摘要

随着每天有大量视频(如 Youtube、Hulu)上传到线上,视频处理与分析已成为一项紧迫任务。从视频中提取具有代表性的关键帧在视频处理与分析中非常重要,因为它能大幅减少计算资源与时间消耗。尽管近期已取得很大进展,大规模视频分类仍是一个开放性问题,因为现有方法未能同时很好地平衡性能与效率。为应对该问题,本文提出一种结合卷积神经网络(CNN)与时间段密度峰值聚类(TSDPC)的无监督关键帧检索方法。所提出的 TSDPC 是一个通用且强大的框架,与以往工作相比具有两点优势:其一可自动计算关键帧数量,其二是能保留视频的时间信息,从而提升视频分类效率。此外,在 CNN 之上加入长短期记忆网络(LSTM)以进一步提升分类性能,并提出一种不同输入网络的权重融合策略来增强性能。通过同时优化视频分类与关键帧提取,我们获得了更好的分类性能与更高的效率。我们在两个流行数据集(即 HMDB51 与 UCF101)上评估了该方法,实验结果一致表明,与最先进方法相比,我们的策略具有具竞争力的性能与效率。

关键词

引用

@article{arxiv.2211.06742,
  title  = {Deep Unsupervised Key Frame Extraction for Efficient Video Classification},
  author = {Hao Tang and Lei Ding and Songsong Wu and Bin Ren and Nicu Sebe and Paolo Rota},
  journal= {arXiv preprint arXiv:2211.06742},
  year   = {2022}
}

备注

Accepted to TOMM