基于自监督的时间关系建模用于动作分割
计算机视觉与模式识别
2020-12-15 v1 人工智能
摘要
视频中的时间关系建模对于人类动作理解(如动作识别与动作分割)至关重要。尽管图卷积网络(GCNs)在许多任务的关系推理中展现出良好优势,但将其有效应用于长视频序列仍具挑战。主要原因在于大量节点(即视频帧)使 GCNs 难以捕捉和建模视频中的时间关系。为解决此问题,本文引入一种有效的 GCN 模块——膨胀时间图推理模块(DTGRM),旨在以不同时间跨度建模视频帧间的时间关系与依赖。特别地,我们通过构建多级膨胀时间图来捕捉和建模时间关系,其中节点表示视频中不同时刻的帧。此外,为增强所提模型的时间推理能力,提出一项辅助自监督任务,以鼓励膨胀时间图推理模块发现并纠正视频中的错误时间关系。我们的 DTGRM 模型在三个具挑战性数据集上优于 SOTA 动作分割模型:50Salads、Georgia Tech Egocentric Activities (GTEA) 和 Breakfast 数据集。代码见 https://github.com/redwang/DTGRM。
引用
@article{arxiv.2012.07508,
title = {Temporal Relational Modeling with Self-Supervision for Action Segmentation},
author = {Dong Wang and Di Hu and Xingjian Li and Dejing Dou},
journal= {arXiv preprint arXiv:2012.07508},
year = {2020}
}
备注
Accepted by the Thirty-Fifth AAAI Conference on Artificial Intelligence (AAAI-21)