IE2Video:将预训练扩散模型适用于基于事件的视频重建
计算机视觉与模式识别
2025-12-08 v1
摘要
监控、机器人和可穿戴系统中的连续视频监控面临一个根本性的能源约束:常规RGB摄像机通过固定速率捕获消耗大量能源。事件摄像头提供稀疏、由运动驱动的感知,具有低功耗,但产生的异步事件流与RGB视频不同。我们提出一种混合捕获范例,记录稀疏RGB关键帧与持续的事件流,然后在离线重建完整的RGB视频——在保持下游应用的标准视频输出的同时,减少捕获功耗。我们提出Image and Event to Video (IE2Video)任务:从单个初始帧和后续事件摄像头数据重建RGB视频序列。我们研究了两种架构策略:为RGB生成改编自回归模型(HyperE2VID),以及通过学习编码器和低秩适配将事件表示注入预训练文本到视频扩散模型(LTX)。我们的实验表明,基于扩散的方法在感知质量上优于自回归基线33%(0.283 vs 0.422 LPIPS)。我们在三个事件摄像头数据集(BS-ERGB、HS-ERGB远/近)上进行验证,序列长度从32-128帧不等,展示了在未见捕获配置下的强大跨数据集泛化能力。
引用
@article{arxiv.2512.05240,
title = {IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction},
author = {Dmitrii Torbunov and Onur Okuducu and Yi Huang and Odera Dim and Rebecca Coles and Yonggang Cui and Yihui Ren},
journal= {arXiv preprint arXiv:2512.05240},
year = {2025}
}