面向事件相机的时序增强自监督预训练
计算机视觉与模式识别
2025-08-05 v1 机器学习
摘要
长期时序信息对基于事件的感知任务至关重要,因为原始事件仅编码像素亮度变化。近期研究表明,在从头训练时,循环模型在此类任务中优于前馈模型。然而,在利用自监督预训练权重时,前馈模型可超越其循环对手。当前针对事件-based 预训练的自监督学习方法大致模仿 RGB 图像-based 方法。它们在短时间间隔内的原始事件上进行前馈模型预训练,忽略了事件的时序信息。本文引入 TESPEC,这是一个针对学习时空信息的自监督预训练框架。TESPEC 特别适合循环模型,因为它是首个在预训练中利用长事件序列的框架。TESPEC 采用掩码图像建模范式,引入新的重建目标。我们设计一种新方法,将事件累积为包含高层次场景语义信息的伪灰度视频,该方法对传感器噪声鲁棒,并减少运动模糊。因此,重建此目标要求模型推理事件的长期历史。广泛实验表明,我们在下游任务中实现了领先的效果,包括目标检测、语义分割和单目深度估计。项目网页:https://mhdmohammadi.github.io/TESPEC_webpage。
引用
@article{arxiv.2508.00913,
title = {TESPEC: Temporally-Enhanced Self-Supervised Pretraining for Event Cameras},
author = {Mohammad Mohammadi and Ziyi Wu and Igor Gilitschenski},
journal= {arXiv preprint arXiv:2508.00913},
year = {2025}
}
备注
Accepted at IEEE/CVF International Conference on Computer Vision (ICCV) 2025