面向时空图卷积网络几何理解的研究
图像与视频处理
2023-12-14 v1 信号处理
摘要
时空图卷积网络(STGCN)已成为基于骨架的人体动作识别中一种理想的模型。尽管取得了最先进的性能,但对这些模型所学表示的理解仍然有限,这阻碍了它们在关键和现实场景中的应用。虽然文献中已有对CNN模型进行逐层分析的研究,但据我们所知,尚无关于使用STGCN在时空数据上学到的嵌入的逐层可解释性研究。本文中,我们首先提出使用从每一层输入数据的特征表示中获得的局部数据集图(DS-Graph),来建立对STGCN逐层嵌入几何的理解。为此,我们开发了一种基于窗口的动态时间规整(DTW)方法,用于计算具有不同时间长度数据序列之间的距离。为验证我们的发现,我们开发了一种专为时空数据定制的逐层时空图梯度加权类激活映射(L-STG-GradCAM)技术。该方法使我们能够可视化分析和解释STGCN网络中的每一层。我们利用表示的标签平滑度来刻画STGCN每一层学习到的功能,并使用我们的L-STG-GradCAM方法对其进行可视化。我们提出的方法是通用的,可以为不同应用中的STGCN架构提供有价值的见解。然而,本文专注于人体活动识别任务作为一个代表性应用。我们的实验表明,STGCN模型在其初始层学习捕捉一般人体运动的表示,而仅在较深层才区分不同的动作。这解释了实验观察结果,即微调更深的层对于相关任务之间的迁移效果良好。
引用
@article{arxiv.2312.07777,
title = {Towards a geometric understanding of Spatio Temporal Graph Convolution Networks},
author = {Pratyusha Das and Sarath Shekkizhar and Antonio Ortega},
journal= {arXiv preprint arXiv:2312.07777},
year = {2023}
}