LaVieID:用于身份保持视频生成的局部自回归扩散 Transformer
计算机视觉与模式识别
2025-08-12 v1
摘要
在本文中,我们提出了 LaVieID,一个新颖的局部自回归视频扩散框架,旨在解决具有挑战性的身份保持文本到视频任务。LaVieID 的核心思想是从空间和时间两个角度减轻扩散 Transformer(DiTs)随机全局生成过程中固有的身份信息丢失问题。具体来说,与现有 DiTs 中对面部潜在状态的全局和非结构化建模不同,LaVieID 引入了一个局部路由器,通过细粒度局部面部结构的加权组合来显式表示潜在状态。这减轻了不希望出现的特征干扰,并促使 DiTs 捕捉独特的面部特征。此外,LaVieID 中集成了一个时间自回归模块,用于在视频解码前细化去噪后的潜在 token。该模块将潜在 token 按时间划分为块,利用其长程时间依赖性来预测用于修正 token 的偏置,从而显著增强帧间身份一致性。因此,LaVieID 可以生成高保真度的个性化视频,并达到最先进的性能。我们的代码和模型可在 https://github.com/ssugarwh/LaVieID 获取。
引用
@article{arxiv.2508.07603,
title = {LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation},
author = {Wenhui Song and Hanhui Li and Jiehui Huang and Panwen Hu and Yuhao Cheng and Long Chen and Yiqiang Yan and Xiaodan Liang},
journal= {arXiv preprint arXiv:2508.07603},
year = {2025}
}
备注
Accepted to ACM MM 2025