中文

COMEDIAN:基于 Transformer 的动作 spotting 自监督学习与知识蒸馏方法

计算机视觉与模式识别 2023-10-27 v2 人工智能 机器学习

摘要

我们提出 COMEDIAN,一种用于初始化时空 Transformer 以进行动作 spotting 的新颖流程,其包含自监督学习与知识蒸馏。动作 spotting 是一项时间戳级的时间动作检测任务。我们的流程由三步组成,包含两个初始化阶段。首先,我们使用短视频作为输入对空间 Transformer 进行自监督初始化。此外,我们初始化一个时序 Transformer,通过从与每个短视频片段对齐的预计算特征库进行知识蒸馏,利用全局上下文增强空间 Transformer 的输出。在最后一步,我们将 Transformer 微调至动作 spotting 任务。在 SoccerNet-v2 数据集上进行的实验展示了最先进的性能,并验证了 COMEDIAN 预训练范式的有效性。我们的结果凸显了该预训练流程的若干优势,包括相较于未预训练模型具有更优的性能和更快的收敛速度。

关键词

引用

@article{arxiv.2309.01270,
  title  = {COMEDIAN: Self-Supervised Learning and Knowledge Distillation for Action Spotting using Transformers},
  author = {Julien Denize and Mykola Liashuha and Jaonary Rabarisoa and Astrid Orcesi and Romain Hérault},
  journal= {arXiv preprint arXiv:2309.01270},
  year   = {2023}
}

备注

Source code is available here: https://github.com/juliendenize/eztorch