EchoShot:多镜头人像视频生成
计算机视觉与模式识别
2025-06-23 v1
摘要
视频扩散模型大幅提升了艺术工作流程的生产力,具有高质量的人像视频生成能力。然而,现有管道主要受限于单镜头创建,而真实世界应用迫切需要具有身份一致性和灵活内容可控性的多镜头。在本工作中,我们提出EchoShot,一个基于基础视频扩散模型构建的原生可扩展的人像定制多镜头框架。首先,我们在视频扩散变换器架构中提出了shot-aware位置嵌入机制,以建模镜头间变异并在多镜头视觉内容及其文本描述之间建立复杂对应关系。这一简单而有效的设计使我们能够直接在多镜头视频数据上进行训练,而无需引入额外的计算开销。为促进多镜头场景下的模型训练,我们构建了PortraitGala,一个大规模且高保真的人类中心视频数据集,具有跨镜头身份一致性和细粒度描述,包括面部特征、服装和动态运动。为进一步提高适用性,我们将EchoShot扩展到参考图像基于个性化多镜头生成和具有无限镜头数的长视频合成。广泛的评估表明,EchoShot在人像视频多镜头生成中实现了卓越的身份一致性以及属性级可控性。值得注意的是,所提出的框架表明其作为通用多镜头视频建模的基础范式具有潜力。
引用
@article{arxiv.2506.15838,
title = {EchoShot: Multi-Shot Portrait Video Generation},
author = {Jiahao Wang and Hualian Sheng and Sijia Cai and Weizhan Zhang and Caixia Yan and Yachuang Feng and Bing Deng and Jieping Ye},
journal= {arXiv preprint arXiv:2506.15838},
year = {2025}
}