中文

XKD:用于视频表示学习的跨模态知识蒸馏与域对齐

计算机视觉与模式识别 2023-12-27 v5

摘要

我们提出 XKD,一种从无标签视频中学习有意义表示的新型自监督框架。XKD 通过两个伪目标进行训练。首先,执行掩码数据重建以从音频和视觉流中学习模态特定表示。接下来,通过教师-学生设置,在两模态间执行自监督跨模态知识蒸馏以学习互补信息。我们引入一种新颖的域对齐策略来解决音频与视觉模态间的域差异,从而实现有效的跨模态知识蒸馏。此外,为开发能处理音频与视觉流的通用途网络,引入了 XKD 的模态不可知变体,其对不同音频与视觉任务使用相同的预训练骨干。我们提出的跨模态知识蒸馏在 UCF101、HMDB51 和 Kinetics400 上将视频动作分类提升了 8%8\%14%14\%。此外,XKD 在 Kinetics-Sound 上将多模态动作分类提升了 5.5%5.5\%。XKD 在 ESC50 上的声音分类表现出最先进性能,取得了 96.5%96.5\% 的 top-1 准确率。

关键词

引用

@article{arxiv.2211.13929,
  title  = {XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning},
  author = {Pritam Sarkar and Ali Etemad},
  journal= {arXiv preprint arXiv:2211.13929},
  year   = {2023}
}

备注

AAAI 2024