DiTPainter:基于扩散 Transformer 的高效视频填洞
计算机视觉与模式识别
2025-05-20 v3
摘要
许多现有的视频填洞算法利用光流图构成相应的映射,然后通过映射将相邻帧的像素传递到缺失区域。尽管传递机制有效,但在处理不准确的光流或大掩码时,可能会遇到模糊和不一致的问题。最近,扩散 Transformer (DiT) 作为视频生成任务的革命性技术不断涌现。然而,现已预训练的 DiT 模型包含大量参数,使得将其应用于视频填洞任务非常耗时。本文提出DiTPainter,一个基于扩散 Transformer (DiT) 的端到端视频填洞模型。DiTPainter 使用专为视频填洞设计的高效 transformer 网络,该网络是从头训练而来,而非初始化自大型预训练模型。DiTPainter 可处理任意长度的视频,并可用于视频去字幕和视频完成任务,同时保持可接受的时间成本。实验表明,DiTPainter 在更高的质量和更好的时空一致性方面优于现有的视频填洞算法。
关键词
引用
@article{arxiv.2504.15661,
title = {DiTPainter: Efficient Video Inpainting with Diffusion Transformers},
author = {Xian Wu and Chang Liu},
journal= {arXiv preprint arXiv:2504.15661},
year = {2025}
}