ConsID-Gen:面向姿态不变且身份保持的图像到视频生成
计算机视觉与模式识别
2026-02-11 v1
摘要
图像到视频生成(I2V)在文本指令指引下,将静态图像动画化为具有时间一致性的视频序列,但在保持细粒度对象身份的同时应对姿态变化仍是持久挑战。不同于文本到视频模型,现有I2V管道常因单视图2D观察的稀疏性和弱跨模态对齐,导致出现外观漂移和几何畸变等问题。我们从数据和模型两个层面解决此问题。首先,我们构建了ConsIDVid—a 大规模以对象为中心的数据集,采用可扩展的管道生成高质量、时间对齐的视频,并建立ConsIDVid-Bench,在此框架下提出用于多视角一致性的基准测试与评估框架,使用对细微几何和外观偏差敏感的指标。我们进一步提出ConsID-Gen—a 基于姿态辅助的I2V生成框架,通过为首帧增添未姿态化辅助视图,并通过双流视觉-几何编码器以及文本-视觉连接器融合语义与结构线索,实现统一的条件化用于扩散转换器背板。ConsIDVid-Bench上的实验表明,ConsID-Gen 在多个指标上均显著优于现有视频生成模型(如 Wan2.1 和 HunyuanVideo),在挑战性真实场景下展现出卓越的身份保真度和时间一致性。我们将在 https://myangwu.github.io/ConsID-Gen 发布模型和数据集。
引用
@article{arxiv.2602.10113,
title = {ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation},
author = {Mingyang Wu and Ashirbad Mishra and Soumik Dey and Shuo Xing and Naveen Ravipati and Hansi Wu and Binbin Li and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2602.10113},
year = {2026}
}
备注
Project page: https://myangwu.github.io/ConsID-Gen