TransPixeler:实现带透明度的文本到视频生成
计算机视觉与模式识别
2025-01-22 v2
摘要
文本到视频生成模型取得了显著进展,使其能够应用于娱乐、广告和教育等多样化应用场景。然而,生成包含 alpha 通道的 RGBA 视频仍是一个挑战,这主要源于数据集有限以及难以适应现有模型。Alpha 通道对于视觉特效 (VFX) 至关重要,允许透明元素(如烟雾和反射)无缝融合到场景中。我们介绍 TransPixeler,一种扩展预训练视频模型以生成 RGBA 视频的方法,同时保留原始 RGB 能力。TransPixeler 采用扩散转换器 (DiT) 架构,融入 alpha 专用 token,并利用 LoRA 微调技术实现 RGB 与 alpha 通道的联合生成,确保高一致性。通过优化注意力机制,TransPixeler 保留了原始 RGB 模型的优势,并在有限训练数据下实现了 RGB 与 alpha 通道之间的强对齐。我们的方法有效生成多样且一致的 RGBA 视频,推动了视觉特效和交互内容创建的可能性。
引用
@article{arxiv.2501.03006,
title = {TransPixeler: Advancing Text-to-Video Generation with Transparency},
author = {Luozhou Wang and Yijun Li and Zhifei Chen and Jui-Hsien Wang and Zhifei Zhang and He Zhang and Zhe Lin and Yingcong Chen},
journal= {arXiv preprint arXiv:2501.03006},
year = {2025}
}
备注
Project page: https://wileewang.github.io/TransPixar/