基于结构感知去噪的零样本合成视频真实性提升
计算机视觉与模式识别
2025-11-19 v1 人工智能
摘要
我们提出一种用于增强合成视频真实性的方法,可从模拟器重新渲染合成视频以实现照片级真实感。我们的真实性提升方法是一个零样本框架,旨在在空间和时间域中保留合成视频的多级结构,基于扩散视频基础模型构建,无需进一步微调。具体而言,我们通过辅助模型对合成视频进行结构感知信息估计(如深度图、语义图和边缘图),并将其作为生成/去噪过程的条件输入,而非从模拟器中提取信息。这种引导确保了增强后的视频在结构和语义层面与原始合成视频保持一致。我们的做法简单而通用且强大:我们在实验中表明,其在结构一致性方面优于现有基线,同时保持最先进的照片级真实性质感。
引用
@article{arxiv.2511.14719,
title = {Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising},
author = {Yifan Wang and Liya Ji and Zhanghan Ke and Harry Yang and Ser-Nam Lim and Qifeng Chen},
journal= {arXiv preprint arXiv:2511.14719},
year = {2025}
}
备注
Project Page: https://wyf0824.github.io/Video_Realism_Enhancement/