中文

TransAnimate:将图层扩散驯服以生成RGBA视频

计算机视觉与模式识别 2025-03-25 v1

摘要

文本到视频生成模型在近年来取得了显著进展。然而,生成带有透明度通道(alpha通道)的RGBA视频以实现透明和视觉效果仍然是一个重大挑战,主要由于合适数据集的稀缺以及适应现有模型以适用于此目的的复杂性。为此,我们提出了TransAnimate框架,该框架将RGBA图像生成技术与视频生成模块集成,实现动态和透明视频的创建。TransAnimate有效地利用预训练的文本到透明图像模型权重,并将其与在RGB视频上训练的时序模型和可控性插件结合,用于适配可控RGBA视频生成任务。此外,我们引入了交互式运动引导控制机制,其中定向箭头定义运动,颜色调整缩放,为设计游戏效果提供精确且直观的控制。为进一步缓解数据稀缺问题,我们开发了创建RGBA视频数据集的管道,集成了高质量的游戏特效视频、提取的前景对象以及合成透明视频。全面实验表明,TransAnimate能够生成高质量的RGBA视频,使其成为游戏和视觉效果应用中实用且有效的工具。

关键词

引用

@article{arxiv.2503.17934,
  title  = {TransAnimate: Taming Layer Diffusion to Generate RGBA Video},
  author = {Xuewei Chen and Zhimin Chen and Yiren Song},
  journal= {arXiv preprint arXiv:2503.17934},
  year   = {2025}
}