中文

AnyID: 超高保真通用身份保持视频生成框架:从任意视觉参考生成

计算机视觉与模式识别 2026-03-27 v1

摘要

身份保持视频生成为创意表达提供了强大的工具,使用户能够自定义包含其钟爱角色的视频。然而,现有方法通常针对单一身份参考进行设计和优化。这一假设限制了创意灵活性,无法充分适应多样化的真实输入格式。依赖单一来源也属于问题场景,导致固有的歧义性设置,使模型在新情境下忠实再现身份困难。为此,我们提出AnyID,一个超高保真身份保持视频生成框架,其包含两个核心贡献:第一,引入可扩展全 Referencing 架构,有效将异构身份输入(如面部、肖像和视频)统一为 cohesive 表示;第二,提出主 Referencing 生成范式,指定一个参考作为标准锚点,并使用新颖的差分提示实现精确的属性级可控性。我们在大规模精心筛选的数据集上进行训练,以确保稳健性和高保真度,然后进行最终的强化学习微调。该过程利用由人类评估构建的偏好数据集,其中标注员根据身份保真度和提示可控性两个关键标准进行视频的成对比较。广泛的评估表明,AnyID 实现了超高身份保真度以及在不同任务设置下的优越属性级可控性。

关键词

引用

@article{arxiv.2603.25188,
  title  = {AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References},
  author = {Jiahao Wang and Hualian Sheng and Sijia Cai and Yuxiao Yang and Weizhan Zhang and Caixia Yan and Bing Deng and Jieping Ye},
  journal= {arXiv preprint arXiv:2603.25188},
  year   = {2026}
}