中文

基于渐进块丢弃的时间动作检测模型压缩

计算机视觉与模式识别 2025-03-24 v1

摘要

时间动作检测(TAD)旨在识别并定位未剪辑视频中的动作实例,这是许多视频理解任务的必备功能。然而,近期模型性能的提升得益于更大的特征提取器和数据集,导致计算需求增加。这给依赖有限计算资源的应用(如自动驾驶和机器人)带来了挑战。虽然现有的通道修剪方法可以压缩这些模型,但减少通道数往往会阻碍 GPU 的并行效率,由于小矩阵之间的低效乘法。我们提出了一种渐进块丢弃方法,该方法在保留层宽度的同时减少模型深度。如此一来,我们仍使用大型矩阵进行计算,但减少乘法次数。我们的方法包含两个步骤:首先,丢弃对模型性能影响最小的冗余块;其次,采用参数高效的跨深度对齐技术,对压缩后的模型进行微调以恢复模型准确率。我们的方法在两个TAD基准数据集(THUMOS14 和 ActivityNet-1.3)上实现了25%的计算开销降低,以实现无损压缩。更关键的是,我们实证表明,该方法与通道修剪方法是正交的,可以与其结合以获得进一步的效率提升。

关键词

引用

@article{arxiv.2503.16916,
  title  = {Temporal Action Detection Model Compression by Progressive Block Drop},
  author = {Xiaoyong Chen and Yong Guo and Jiaming Liang and Sitong Zhuang and Runhao Zeng and Xiping Hu},
  journal= {arXiv preprint arXiv:2503.16916},
  year   = {2025}
}

备注

Accepted to CVPR 2025