中文

用于人体动作识别的多视角知识蒸馏Transformer

计算机视觉与模式识别 2023-03-28 v1

摘要

近来,基于Transformer的方法已被用于提升人体动作识别的性能。然而,这些研究大多假设多视角数据完整,而现实场景中未必如此。因此,本文提出一种新颖的多视角知识蒸馏Transformer(MKDT)框架,由教师网络与学生网络组成。该框架旨在处理现实应用中的不完整人体动作问题。具体而言,多视角知识蒸馏Transformer采用带偏移窗口的分层视觉Transformer以捕获更多时空信息。实验结果表明,我们的框架在三个公开数据集上优于基于CNN的方法。

关键词

引用

@article{arxiv.2303.14358,
  title  = {Multi-view knowledge distillation transformer for human action recognition},
  author = {Ying-Chen Lin and Vincent S. Tseng},
  journal= {arXiv preprint arXiv:2303.14358},
  year   = {2023}
}