中文

更高效的骨架表示学习:无解码器的掩码建模

计算机视觉与模式识别 2026-03-13 v2

摘要

骨架基方法的动作表示学习景观从对比学习(CL)演变为掩码自编码(MAE)架构。然而,每种范式都存在内在限制:CL往往忽视细粒度的局部细节,而MAE则负担沉重的解码器。此外,MAE严重存在计算不对称——在预训练期间受益于高效掩码,但在下游任务中需要对整个序列进行穷尽式处理。为解决这些瓶颈,我们提出SLiM(Skeleton Less is More),一个新的统一框架,将掩码建模与对比学习通过共享编码器进行融合。通过放弃重建解码器,SLiM不仅消除了计算冗余,还迫使编码器直接捕获判别特征。SLiM是首个实现代表学习的无解码器掩码建模框架。关键的是,为防止高骨架-时间相关性导致平凡重建,我们引入语义管道掩码,并设计骨架感知数据增强,以确保不同时间粒度下的解剖一致性。广泛的实验表明,SLiM在所有下游协议上均实现了最先进的性能。更重要的是,我们的方法在实现卓越准确性的同时,推断计算成本比现有MAE方法降低了7.89倍。

关键词

引用

@article{arxiv.2603.10648,
  title  = {Less is More: Decoder-Free Masked Modeling for Efficient Skeleton Representation Learning},
  author = {Jeonghyeok Do and Yun Chen and Geunhyuk Youk and Munchurl Kim},
  journal= {arXiv preprint arXiv:2603.10648},
  year   = {2026}
}

备注

Please visit our project page at https://kaist-viclab.github.io/SLiM_site/