基于事件相机的时序引导视觉基础模型
计算机视觉与模式识别
2025-11-11 v1
摘要
事件相机在恶劣环境下的视觉任务中具有独特优势,但处理异步事件流仍是开放挑战。现有方法依赖特定架构或资源密集型训练,而将现代视觉基础模型(VFM)预训练于图像数据所潜在的潜力尚未充分探索。为此,我们提出时序引导视觉基础模型(TGVFM),一种新型框架,将 VFM 与我们提出的时序上下文融合模块无缝集成,以弥合这一差距。我们的时序模块包含三个关键组件:(1)长程时序注意力以建模全局时序依赖性;(2)双空间时序注意力用于多尺度帧关联;(3)深度特征引导机制用于语义-时序特征融合。通过在真实数据上重新训练事件到视频模型并利用基于 Transformer 的 VFM,TGVFM 在保持时空动态的同时发挥了预训练表示的潜能。实验表明,在语义分割、深度估计和目标检测等任务上实现最先进(SoTA)性能,分别比现有方法提升了 16%、21% 和 16%。总体而言,本工作开启了图像基础 VFM 向事件视觉中进行时序推理的跨模态潜能。代码已公开于 https://github.com/XiaRho/TGVFM。
引用
@article{arxiv.2511.06238,
title = {Temporal-Guided Visual Foundation Models for Event-Based Vision},
author = {Ruihao Xia and Junhong Cai and Luziwei Leng and Liuyi Wang and Chengju Liu and Ran Cheng and Yang Tang and Pan Zhou},
journal= {arXiv preprint arXiv:2511.06238},
year = {2025}
}