GraphVid:仅需少量节点即可理解视频
计算机视觉与模式识别
2022-07-21 v2 人工智能
摘要
我们提出了一种将感知有意义的特征编码为图的视频简洁表示。借助该表示,我们旨在利用视频中大量的冗余并节省计算。首先,我们通过将超像素视为图节点并在相邻超像素间建立空间与时间连接,构建基于超像素的视频图表示。然后,我们利用图卷积网络处理该表示并预测所需输出。结果,我们能够以少得多的参数训练模型,这转化为较短的训练周期并降低对计算资源的需求。在公开数据集 Kinetics-400 和 Charades 上的综合实验研究表明,所提方法极具成本效益,并在训练和推理期间使用有限的商用硬件。它将计算需求降低了 10 倍,同时取得了与最先进方法相当的结果。我们相信所提方法是一个有前景的方向,可开启更高效的视频理解之门,并使更多资源受限的用户能在此研究领域蓬勃发展。
引用
@article{arxiv.2207.01375,
title = {GraphVid: It Only Takes a Few Nodes to Understand a Video},
author = {Eitan Kosman and Dotan Di Castro},
journal= {arXiv preprint arXiv:2207.01375},
year = {2022}
}
备注
Accepted to ECCV2022 (Oral)