中文

InfiniteYou:保持身份的灵活照片重创

计算机视觉与模式识别 2025-07-30 v2 机器学习

摘要

实现灵活且高保真的保持身份图像生成仍然是一项艰巨的任务,特别是对于像 FLUX 这样的高级 Diffusion Transformers (DiTs)。我们引入了 InfiniteYou (InfU),这是最早利用 DiTs 完成此任务的稳健框架之一。InfU 解决了现有方法的重大问题,例如身份相似度不足、文本-图像对齐度差以及生成质量和美感低。InfU 的核心是 InfuseNet,该组件通过残差连接将身份特征注入 DiT 基础模型,在保持生成能力的同时增强了身份相似度。多阶段训练策略,包括预训练和使用合成单人多样本(SPMS)数据的监督微调(SFT),进一步改善了文本-图像对齐,提升了图像质量,并缓解了人脸复制粘贴问题。大量实验表明,InfU 实现了最先进的性能,超越了现有基线。此外,InfU 的即插即用设计确保了与各种现有方法的兼容性,为更广泛的社区做出了宝贵贡献。

关键词

引用

@article{arxiv.2503.16418,
  title  = {InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity},
  author = {Liming Jiang and Qing Yan and Yumin Jia and Zichuan Liu and Hao Kang and Xin Lu},
  journal= {arXiv preprint arXiv:2503.16418},
  year   = {2025}
}

备注

ICCV 2025 (Highlight). Project page: https://bytedance.github.io/InfiniteYou/ Code and model: https://github.com/bytedance/InfiniteYou