基于时空和频率增强深度神经网络的时间事件重建
计算机视觉与模式识别
2026-05-26 v1
摘要
事件相机相对于传统帧式相机具有显著优势,包括高时间分辨率、低延迟和能源效率。这些特征使其适用于高速和高动态范围场景获取场景;然而,缺乏密集强度帧限制了基于常规计算机视觉方法进行场景理解的直接适用性。事件到视频(E2V)重建旨在弥合这一差距,通过将非同步事件流转换为一序列同步视频帧。现有的基于卷积神经网络和Transformer的E2V重建方法主要在空间域内工作,常常难以恢复细节结构,同时抑制严重的重建伪影。为解决这些问题,我们提出了MSFET-E2V,即一种新型的多尺度频率增强Transformer模型。其核心位于跨域注意力模块,将时空特征与来自离散小波变换的频率感知表示相融合。与仅依赖空间注意力的先前方法不同,我们的方法通过考虑低频和高频成分,有效地捕获局部和全局结构,从而增强细节保留和对各种运动场景的鲁棒性。此外,我们提出了轻量级的 wavelet增强跳过模块,用作跳过连接,通过联合时空频域处理促进伪影抑制和结构细节细化。广泛的实验表明,MSFET-E2V在多个真实世界事件数据集上优于最先进的方法,显著提升重建质量。而且,与现有的基于Transformer的方法相比,我们提出的模型显著减少了参数数量、GPU内存使用和推理时间。
引用
@article{arxiv.2605.25804,
title = {Event-to-Video Reconstruction using Spatio-Temporal and Frequency-Enhanced Deep Neural Networks},
author = {Ramna Maqsood and Paulo Nunes and Luís Ducla Soares and Caroline Conti},
journal= {arXiv preprint arXiv:2605.25804},
year = {2026}
}