中文

LORTSAR:面向骨架基于动作识别的低秩 Transformer

计算机视觉与模式识别 2024-07-23 v1

摘要

基于骨架的人体动作识别的最新 Transformer 模型复杂度高,计算效率和资源利用率面临显著挑战。本文探索将奇异值分解 (SVD) 应用于有效减小这些预训练模型的规模,以最小化资源消耗同时保持精度。我们的方法,LORTSAR (LOw-Rank Transformer for Skeleton-based Action Recognition),包括用于补偿模型压缩可能导致的精度下降的微调步骤,并应用于两个领先的 Transformer 模型,"Hyperformer" 和 "STEP-CATFormer"。在 "NTU RGB+D" 和 "NTU RGB+D 120" 数据集上的实验结果表明,我们的方法能够在识别精度几乎不受影响甚至有所提升的情况下,大幅度减少模型参数数量。这一发现确认了将 SVD 与后压缩微调相结合可提升模型效率,为在人体动作识别领域实现更可持续、轻量级且高性能的技术铺平了道路。

关键词

引用

@article{arxiv.2407.14655,
  title  = {LORTSAR: Low-Rank Transformer for Skeleton-based Action Recognition},
  author = {Soroush Oraki and Harry Zhuang and Jie Liang},
  journal= {arXiv preprint arXiv:2407.14655},
  year   = {2024}
}

备注

12 pages