用于人体动作识别的多视角知识蒸馏Transformer
计算机视觉与模式识别
2023-03-28 v1
摘要
近来,基于Transformer的方法已被用于提升人体动作识别的性能。然而,这些研究大多假设多视角数据完整,而现实场景中未必如此。因此,本文提出一种新颖的多视角知识蒸馏Transformer(MKDT)框架,由教师网络与学生网络组成。该框架旨在处理现实应用中的不完整人体动作问题。具体而言,多视角知识蒸馏Transformer采用带偏移窗口的分层视觉Transformer以捕获更多时空信息。实验结果表明,我们的框架在三个公开数据集上优于基于CNN的方法。
引用
@article{arxiv.2303.14358,
title = {Multi-view knowledge distillation transformer for human action recognition},
author = {Ying-Chen Lin and Vincent S. Tseng},
journal= {arXiv preprint arXiv:2303.14358},
year = {2023}
}