中文

BIMM:用于视频表征学习的类脑掩码建模

计算机视觉与模式识别 2024-05-22 v1

摘要

人类大脑的视觉通路包含两个子通路,即腹侧通路和背侧通路,分别专注于物体识别和动态信息建模。两个通路均包含多层结构,每层负责处理视觉信息的不同方面。受人类大脑视觉信息处理机制的启发,我们提出了类脑掩码建模(BIMM)框架,旨在从视频中学习全面的表征。具体而言,我们的方法由腹侧和背侧分支组成,分别学习图像和视频表征。两个分支均采用 Vision Transformer (ViT) 作为骨干网络,并使用掩码建模方法进行训练。为实现大脑不同视觉皮层的目标,我们将每个分支的编码器分割为三个中间块,并使用轻量级解码器重建渐进预测目标。此外,受视觉通路中信息共享机制的启发,我们在训练期间提出了分支间的部分参数共享策略。大量实验表明,与最先进的方法相比,BIMM 取得了优越的性能。

关键词

引用

@article{arxiv.2405.12757,
  title  = {BIMM: Brain Inspired Masked Modeling for Video Representation Learning},
  author = {Zhifan Wan and Jie Zhang and Changzhen Li and Shiguang Shan},
  journal= {arXiv preprint arXiv:2405.12757},
  year   = {2024}
}