中文

RefDecoder:用于条件视频解码以增强视觉生成

计算机视觉与模式识别 2026-05-15 v1 机器学习

摘要

视频生成驱动着广泛的下游应用。然而,虽然事实上的标准——即潜在扩散模型——通常采用高度条件化的去噪网络,但其解码器往往保持无条件。我们注意到,这种架构不对称导致相对于输入图像的细节和一致性损失显著。为解决此问题,我们认为解码器需要相同的条件化才能保持结构完整性。我们引入RefDecoder,这是一种参考条件视频VAE解码器,通过将高保真参考图像信号直接注入解码过程中实现条件化。具体而言,轻量级图像编码器将参考帧映射到细节丰富的高维标记,这些标记在解码器每个上采样阶段与去噪后的视频潜在标记共同处理。我们在几种不同的解码器背bone(例如Wan 2.1和VideoVAE+)上 demonstrate了 consistent improvements,在Inter4K、WebVid和Large Motion重建基准测试中实现了最高达+2.1dB PSNR。值得注意的是,RefDecoder可以直接替换到现有的视频生成系统中,而无需额外微调,并在VBench I2V基准测试中实现subject consistency、background consistency和overall quality scores全方位提升。除了I2V,RefDecoder对广泛的视觉生成任务如风格迁移和视频编辑细化也表现出良好的泛化能力。

关键词

引用

@article{arxiv.2605.15196,
  title  = {RefDecoder: Enhancing Visual Generation with Conditional Video Decoding},
  author = {Xiang Fan and Yuheng Wang and Bohan Fang and Zhongzheng Ren and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2605.15196},
  year   = {2026}
}