VideoSAGE:基于图表示学习的视频摘要
计算机视觉与模式识别
2024-04-17 v1 人工智能
摘要
我们提出了一种基于图的表示学习框架用于视频摘要。首先,我们将输入视频转换为图,其中节点对应每个视频帧。然后,我们通过仅连接指定时间距离内的节点对来对图施加稀疏性。接着,我们将视频摘要任务表述为二值节点分类问题,即精确分类视频帧是否应属于输出摘要视频。这样构建的图旨在捕捉视频帧之间的长程交互,而稀疏性确保模型训练不会遇到内存和计算瓶颈。在两个数据集(SumMe和TVSum)上的实验表明,与现有最先进的摘要方法相比,所提出的轻量模型在计算时间和内存效率上提高了一个数量级,同时保持了有效性。
引用
@article{arxiv.2404.10539,
title = {VideoSAGE: Video Summarization with Graph Representation Learning},
author = {Jose M. Rojas Chaves and Subarna Tripathi},
journal= {arXiv preprint arXiv:2404.10539},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2207.07783