中文

具有时间上下文感知的基于聚类的视频摘要

计算机视觉与模式识别 2024-04-17 v1 人工智能

摘要

在本文中,我们提出了 TAC-SUM,一种新颖且高效的无训练视频摘要方法,该方法通过引入时间上下文解决了现有基于聚类模型的局限性。我们的方法将输入视频划分为带有聚类信息的时间连续片段,从而能够将时间感知注入聚类过程中,使其有别于先前的基于聚类的摘要方法。随后,利用所得的时间感知聚类,通过用于关键帧选择和帧重要性评分的简单规则来计算最终摘要。在 SumMe 数据集上的实验结果证明了我们提出方法的有效性,其性能优于现有的无监督方法,并取得了与最先进的有监督摘要技术相当的性能。我们的源代码可在 \url{https://github.com/hcmus-thesis-gulu/TAC-SUM} 获取以供参考。

关键词

引用

@article{arxiv.2404.04511,
  title  = {Cluster-based Video Summarization with Temporal Context Awareness},
  author = {Hai-Dang Huynh-Lam and Ngoc-Phuong Ho-Thi and Minh-Triet Tran and Trung-Nghia Le},
  journal= {arXiv preprint arXiv:2404.04511},
  year   = {2024}
}

备注

14 pages, 6 figures, accepted in PSIVT 2023