从 CNN-Transformer 模型蒸馏知识以增强人体动作识别
计算机视觉与模式识别
2023-11-03 v1
摘要
本文研究利用知识蒸馏及 CNN 与 ViT 模型结合来改进人体动作识别。研究旨在通过从较大的教师模型迁移知识,提升较小学生模型的性能与效率。所提方法采用 Transformer 视觉网络作为学生模型,卷积网络作为教师模型。教师模型提取局部图像特征,而学生模型利用注意力机制聚焦全局特征。视觉 Transformer(ViT)架构作为一种捕获图像全局依赖的鲁棒框架被引入。此外,讨论了 ViT 的先进变体,即 PVT、Convit、MVIT、Swin Transformer 与 Twins,强调其对计算机视觉任务的贡献。ConvNeXt 模型作为教师模型被引入,以其在计算机视觉中的高效与有效著称。本文给出在 Stanford 40 数据集上的人体动作识别性能结果,比较经与未经知识蒸馏训练的学生模型的准确率与 mAP。结果表明,相较常规设置下训练网络,所提方法显著提升了准确率与 mAP。这些发现强调了在动作识别任务中结合局部与全局特征的潜力。
引用
@article{arxiv.2311.01283,
title = {Distilling Knowledge from CNN-Transformer Models for Enhanced Human Action Recognition},
author = {Hamid Ahmadabadi and Omid Nejati Manzari and Ahmad Ayatollahi},
journal= {arXiv preprint arXiv:2311.01283},
year = {2023}
}