数据高效的事件相机预训练:通过解耦掩码建模
计算机视觉与模式识别
2024-03-04 v1
摘要
本文提出一种新的数据高效的基于体素的事件相机自监督学习方法。我们的预训练克服了以往方法的局限性,这些方法要么通过将事件序列转换为二维图像来利用预训练图像模型,从而牺牲时间信息;要么直接使用配对图像数据进行知识蒸馏以增强事件流的学习。为了使预训练数据高效,我们首先设计了一种语义均匀掩码方法,以解决非均匀数据中不同区域重建难度不同导致的随机掩码学习不平衡问题。此外,我们通过将传统的混合掩码建模过程显式分解为两个分支——局部时空重建和全局语义重建,分别鼓励编码器捕捉局部相关性和全局语义,从而简化了该过程。这种分解使得我们的自监督学习方法能够以最少的预训练数据更快收敛。与以往方法相比,我们的自监督学习方法不依赖配对的RGB图像,却能同时探索多尺度下的空间和时间线索。它展现出优异的泛化性能,并在各种任务中以更少的参数和更低的计算成本实现了显著改进。
引用
@article{arxiv.2403.00416,
title = {Data-efficient Event Camera Pre-training via Disentangled Masked Modeling},
author = {Zhenpeng Huang and Chao Li and Hao Chen and Yongjian Deng and Yifeng Geng and Limin Wang},
journal= {arXiv preprint arXiv:2403.00416},
year = {2024}
}