中文

VideoSAGE:基于图表示学习的视频摘要

计算机视觉与模式识别 2024-04-17 v1 人工智能

摘要

我们提出了一种基于图的表示学习框架用于视频摘要。首先,我们将输入视频转换为图,其中节点对应每个视频帧。然后,我们通过仅连接指定时间距离内的节点对来对图施加稀疏性。接着,我们将视频摘要任务表述为二值节点分类问题,即精确分类视频帧是否应属于输出摘要视频。这样构建的图旨在捕捉视频帧之间的长程交互,而稀疏性确保模型训练不会遇到内存和计算瓶颈。在两个数据集(SumMe和TVSum)上的实验表明,与现有最先进的摘要方法相比,所提出的轻量模型在计算时间和内存效率上提高了一个数量级,同时保持了有效性。

关键词

引用

@article{arxiv.2404.10539,
  title  = {VideoSAGE: Video Summarization with Graph Representation Learning},
  author = {Jose M. Rojas Chaves and Subarna Tripathi},
  journal= {arXiv preprint arXiv:2404.10539},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2207.07783