中文

WithAnyone:面向可控且身份一致的图像生成

计算机视觉与模式识别 2025-10-17 v1 人工智能

摘要

身份一致的生成已成为文本到图像研究中的重要焦点,近期模型取得了显著成效,能够生成与参考身份相匹配的图像。然而,稀缺的大规模包含同一人多张图像的配对数据集迫使大多数方法采用基于重建的训练方式。这种依赖常导致我们称之为复制粘贴的失效模式——模型直接复制参考人脸,而非在姿态、表情或光照等自然变化下保持身份一致。这种过度相似性削弱了可控性,限制了生成的表达能力。为此,我们(1)构建了一个大规模配对数据集 MultiID-2M,针对多人场景设计,为每个身份提供多样化的参考图像;(2)引入一个基准,量化复制粘贴 artifacts 以及身份保真度与变体之间的权衡;(3)提出一种新颖的训练范式,采用对抗性身份损失利用配对数据在保真度与多样性之间取得平衡。这些贡献 culminate 在WithAnyone,一个基于扩散的模型,有效缓解了复制粘贴现象,同时保持强大的身份相似性。广泛的定性和定量实验表明,WithAnyone 显著减少了复制粘贴 artifacts,提高了对姿态和表情的可控性,同时保持卓越的感知质量。用户研究进一步验证,我们的方法在实现高身份保真度的同时,实现了可表达且可控的生成。

关键词

引用

@article{arxiv.2510.14975,
  title  = {WithAnyone: Towards Controllable and ID Consistent Image Generation},
  author = {Hengyuan Xu and Wei Cheng and Peng Xing and Yixiao Fang and Shuhan Wu and Rui Wang and Xianfang Zeng and Daxin Jiang and Gang Yu and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2510.14975},
  year   = {2025}
}

备注

23 Pages; Project Page: https://doby-xu.github.io/WithAnyone/; Code: https://github.com/Doby-Xu/WithAnyone