SkeletonX:基于跨样本特征聚合的数据高效骨架动作识别
计算机视觉与模式识别
2026-01-09 v1
摘要
虽然当前骨架动作识别模型在大规模数据集上表现突出,但其在新应用场景下的适应性仍然具有挑战。当面对新的动作类别、多样化的执行者以及变化的骨架布局时,这些挑战会导致显著的性能下降。此外,收集骨架数据的高成本和技术难度也使得大规模数据收集难以实现。本文聚焦单样本和小规模学习设置,以实现最小化数据下的高效适应。现有方法常常忽视了标签样本之间丰富的相互信息,在低数据场景下导致次优性能。为提升标签数据的效用,我们识别出执行者之间的差异性以及每个动作内部的共性这两个关键属性。我们提出了SkeletonX,一个轻量级的训练管道,可无缝集成到现有的基于图神经网络(GCN)的骨架动作识别器中,在有限标签数据下实现有效训练。首先,我们提出了针对这两个关键属性的定制化样本对构建策略,以形成和聚合样本对。随后,我们开发了一个简洁且高效的特征聚合模块来处理这些样本对。在NTU RGB+D、NTU RGB+D 120和PKU-MMD等多个数据集上进行了广泛实验,使用各种GCN骨干网络,结果表明该管道在仅使用有限数据时即可从零开始有效提升性能。此外,在单样本设置下,它超过了之前的最先进方法,仅需约1/10的参数和更少的FLOPs。代码和数据已提供:https://github.com/zzysteve/SkeletonX
引用
@article{arxiv.2504.11749,
title = {SkeletonX: Data-Efficient Skeleton-based Action Recognition via Cross-sample Feature Aggregation},
author = {Zongye Zhang and Wenrui Cai and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2504.11749},
year = {2026}
}
备注
Accepted by IEEE Transactions on Multimedia (TMM). 13 pages, 7 figures, 11 tables