Vivid-VR:从文本到视频扩散Transformer中蒸馏概念以实现照片级真实感视频复原
计算机视觉与模式识别
2025-09-29 v3
摘要
我们提出了Vivid-VR,这是一种基于DiT的生成式视频复原方法,构建于先进的T2V基础模型之上,其中利用ControlNet来控制生成过程,确保内容一致性。然而,由于不完美的多模态对齐的限制,对此类可控流程的传统微调经常遭受分布漂移的影响,导致纹理真实感和时间连贯性受损。为了解决这一挑战,我们提出了一种概念蒸馏训练策略,该策略利用预训练的T2V模型来合成嵌入了文本概念的训练样本,从而蒸馏其概念理解以保持纹理和时间质量。为了增强生成的可控性,我们重新设计了控制架构,包含两个关键组件:1)一个控制特征投影器,用于从输入视频潜变量中过滤退化伪影,以最大限度地减少它们在生成流程中的传播;2)一个采用双分支设计的新型ControlNet连接器。该连接器协同地将基于MLP的特征映射与交叉注意力机制相结合,用于动态控制特征检索,从而同时实现内容保留和自适应控制信号调制。大量实验表明,Vivid-VR在合成和真实世界基准测试以及AIGC视频上,其性能均优于现有方法,实现了令人印象深刻的纹理真实感、视觉生动性和时间一致性。代码和模型权重已公开于https://github.com/csbhr/Vivid-VR。
引用
@article{arxiv.2508.14483,
title = {Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration},
author = {Haoran Bai and Xiaoxu Chen and Canqian Yang and Zongyao He and Sibin Deng and Ying Chen},
journal= {arXiv preprint arXiv:2508.14483},
year = {2025}
}