中文

CM3AE:统一的RGB帧与事件体素/帧预训练框架

计算机视觉与模式识别 2025-04-18 v1 人工智能

摘要

事件相机因高动态范围、高时间分辨率、低功耗和低延迟等优势近年来受到广泛关注。一些研究者开始在事件数据上进行预训练,但这些工作常常难以与RGB帧建立紧密联系,限制了其在多模态融合场景中的应用。为此,我们提出了一种新的CM3AE预训练框架,用于RGB-Event感知。该框架接受多模态/多视角数据作为输入,包括RGB图像、事件图像和事件体素,为基于事件和RGB-Event融合的下游任务提供稳健支持。具体而言,我们设计了一种多模态融合重建模块,从融合后的多模态特征中重建原始图像,显著增强了模型聚合跨模态互补信息的能力。此外,我们采用多模态对比学习策略,在共享的潜在空间中对齐跨模态特征表示,有效提升了模型的多模态理解能力和捕获全局依赖关系的能力。我们构建了一个包含2,535,759对RGB-Event数据对的大型数据集用于预训练。在五个下游任务上的大量实验充分证明了CM3AE的有效性。源代码和预训练模型将在https://github.com/Event-AHU/CM3AE上发布。

关键词

引用

@article{arxiv.2504.12576,
  title  = {CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework},
  author = {Wentao Wu and Xiao Wang and Chenglong Li and Bo Jiang and Jin Tang and Bin Luo and Qi Liu},
  journal= {arXiv preprint arXiv:2504.12576},
  year   = {2025}
}