LSTC-MDA:基于长短期时序卷积与混合数据增强的骨架动作识别统一框架
计算机视觉与模式识别
2025-09-19 v1 人工智能
摘要
骨架动作识别面临两个长期存在的挑战:标注训练样本的稀缺和难以建模短程与长程时序依赖性。为此,我们提出统一框架 LSTC-MDA,同时改善时序建模和数据多样性。我们引入新型的长短期时序卷积(LSTC)模块,包含平行的短程和长程分支,这两个特征分支随后通过学习到的相似性权重进行自适应对齐与融合,以保留常规步幅为 2 时序卷积丢失的关键长程线索。我们还将联合混合数据增强(JMDA)扩展于输入层的加法混合(Additive Mixup),以增加训练样本的多样性,并限制混合操作仅限于同一摄像头视角,以避免分布迁移。消融实验确认每个组件都有贡献。LSTC-MDA 实现了最先进的成绩:在 NTU 60(X-Sub 和 X-View)上分别达到 94.1% 和 97.5%,在 NTU 120(X-Sub 和 X-Set)上分别达到 90.4% 和 92.0%,在 NW-UCLA 上达到 97.2%。代码:https://github.com/xiaobaoxia/LSTC-MDA。
引用
@article{arxiv.2509.14619,
title = {LSTC-MDA: A Unified Framework for Long-Short Term Temporal Convolution and Mixed Data Augmentation in Skeleton-Based Action Recognition},
author = {Feng Ding and Haisheng Fu and Soroush Oraki and Jie Liang},
journal= {arXiv preprint arXiv:2509.14619},
year = {2025}
}
备注
Submitted to ICASSP