中文

DESSERT:基于残差训练的扩散事件驱动单帧合成

计算机视觉与模式识别 2025-12-22 v1

摘要

视频帧预测从前置帧推断未来帧,但在动态场景中由于缺乏下一帧信息而 suffer from prediction errors。事件相机通过以高时间分辨率异步捕获每个像素的亮度变化来解决这一限制。先前的事件基视频帧预测研究利用事件数据中的运动信息,通常通过预测事件基光流并通过像素错位重建帧。然而,这些方法在像素位移不准时会引入空洞和模糊。为克服这一限制,我们提出DESSERT,一种通过残差训练实现事件驱动单帧合成的扩散框架。利用预训练的稳定扩散模型,我们的方法在inter-frame残差上进行训练以确保时间一致性。训练管道包括两个阶段:(1)事件到残差对齐变分自编码器(ER-VAE),将锚框与目标框之间的事件帧与相应残差对齐,以及(2)条件于事件数据对残差潜在进行去噪的扩散模型。此外,我们引入多样化长度时间(DLT)数据增强,通过训练不同时间长度的帧片段来提高鲁健性。实验结果表明,我们的方法优于现有的事件基重建、图像基视频帧预测、事件基视频帧预测和单向事件基视频帧插值方法,产生更锐利、更具时序一致性的帧合成。

关键词

引用

@article{arxiv.2512.17323,
  title  = {DESSERT: Diffusion-based Event-driven Single-frame Synthesis via Residual Training},
  author = {Jiyun Kong and Jun-Hyuk Kim and Jong-Seok Lee},
  journal= {arXiv preprint arXiv:2512.17323},
  year   = {2025}
}