中文

大面部角度变化下的身份一致视频生成

计算机视觉与模式识别 2026-03-24 v1

摘要

单视图参考到视频的方法在大面部角度变化时往往难以保持身份一致性。这自然促使引入多视图面部参考。然而,仅仅引入额外的参考图像会恶化 \textit{copy-paste} 问题,特别是 \textbf{\textit{view-dependent copy-paste}} artifact,降低面部运动的自然性。虽然交叉配对数据可缓解此问题,但收集此类数据成本较高。为平衡一致性和自然性,我们提出了 \mathrm{Mv}^2\mathrm{ID},一个基于 in-paired 监督的多视图条件框架。我们引入区域遮盖训练策略,以防止捷径学习,并通过鼓励模型在不同视角间聚合互补身份特征来提取关键身份特征。此外,我们设计了参考解耦-RoPE 机制,为视频和条件 token 分配不同的positional encoding,以更好地建模其异构属性。进一步,我们构建了一个包含多样化面部角度变化的大型数据集,并提出了专门的身份一致性和运动自然性评估指标。大量实验表明,我们的方法在保持运动自然性的同时显著提高了身份一致性,超越了使用交叉配对数据训练的现有方法。

关键词

引用

@article{arxiv.2603.21299,
  title  = {Identity-Consistent Video Generation under Large Facial-Angle Variations},
  author = {Bin Hu and Zipeng Qi and Guoxi Huang and Zunnan Xu and Ruicheng Zhang and Chongjie Ye and Jun Zhou and Xiu Li and Jingdong Wang},
  journal= {arXiv preprint arXiv:2603.21299},
  year   = {2026}
}