语义增强的E2VID:事件到视频重建的语义范式
计算机视觉与模式识别
2026-01-08 v2
摘要
事件相机通过异步捕获亮度变化,提供了高速和高动态范围视觉的有前景的感知模式。事件基视觉中的一个基本任务是事件到视频(E2V)重建,即从事件流中恢复强度视频。大多数现有的E2V方法将重建形式化为时空信号恢复问题,依赖时序聚合和空间特征学习来推断强度帧。虽然在某种程度上有效,但这种形式化忽略了一个关键限制:由于基于变化驱动的感知机制,事件流本质上是语义上不确定的,缺乏必需用于可靠重建的对象级结构和上下文信息。在本工作中,我们从语义角度重新审视E2V,认为有效的重建需要超越时空建模,显式地考虑缺失的语义信息。基于这一洞察,我们提出了\textit{Semantic-E2VID},一种语义丰富的端到端E2V框架,将重建重新定义为语义学习、融合和解码的过程。我们的方法首先通过桥接事件表示与从预训练的Segment Anything Model(SAM)中提取的语义来实现语义抽象,同时避免由模态引起的特征漂移。所学到的语义以表示兼容的方式融合到事件潜在空间,使事件特征能够捕获对象级结构和上下文线索。此外,引入语义感知监督,以显式引导重建过程聚焦于语义上有意义的区域,补充常规的像素级和时序目标。广泛的实验在六个公开基准数据集上表明,Semantic-E2VID在所有方面 consistently 优于最先进的E2V方法。
引用
@article{arxiv.2510.17347,
title = {Semantic-E2VID: a Semantic-Enriched Paradigm for Event-to-Video Reconstruction},
author = {Jingqian Wu and Yunbo Jia and Shengpeng Xu and Edmund Y. Lam},
journal= {arXiv preprint arXiv:2510.17347},
year = {2026}
}