Concat-ID:迈向通用身份保持的视频生成
计算机视觉与模式识别
2025-07-03 v3 人工智能
摘要
我们提出了 Concat-ID,一个通用的身份保持视频生成框架。Concat-ID 利用变分自编码器提取图像特征,然后将这些特征沿序列维度与视频潜变量拼接。它完全依赖固有的三维自注意力机制来整合这些特征,无需额外的参数或模块。引入了一种新颖的跨视频配对策略和多阶段训练方案,以平衡身份一致性与面部可编辑性,同时增强视频自然度。大量实验表明,Concat-ID 在单身份和多身份生成方面均优于现有方法,并且能够无缝扩展到多主体场景,包括虚拟试穿和背景可控生成。Concat-ID 为身份保持视频生成建立了新的基准,为广泛的应用提供了通用且可扩展的解决方案。
引用
@article{arxiv.2503.14151,
title = {Concat-ID: Towards Universal Identity-Preserving Video Synthesis},
author = {Yong Zhong and Zhuoyi Yang and Jiayan Teng and Xiaotao Gu and Chongxuan Li},
journal= {arXiv preprint arXiv:2503.14151},
year = {2025}
}