中文

UMO: 基于匹配奖励扩展图像定制中的多身份一致性

计算机视觉与模式识别 2025-09-09 v1 机器学习

摘要

图像定制的最新进展因更强的定制能力而展现出广泛的应用前景。然而,由于人类对面部更为敏感,在保持身份一致性的同时避免多参考图像间的身份混淆仍是一项重大挑战,这限制了定制模型的身份可扩展性。为解决此问题,我们提出了 UMO(Unified Multi-identity Optimization,统一多身份优化)框架,旨在保持高保真的身份保持性并缓解可扩展性带来的身份混淆。基于“多对多匹配”范式,UMO 将多身份生成重新表述为全局分配优化问题,并通过在扩散模型上进行强化学习,普遍释放现有图像定制方法的多身份一致性。为促进 UMO 的训练,我们构建了一个包含合成与真实部分的多参考图像可扩展定制数据集。此外,我们提出了一种新的度量指标来衡量身份混淆。大量实验表明,UMO 不仅显著提升了身份一致性,还在多种图像定制方法上减少了身份混淆,在身份保持维度上树立了开源方法的新 SOTA。代码与模型:https://github.com/bytedance/UMO

关键词

引用

@article{arxiv.2509.06818,
  title  = {UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward},
  author = {Yufeng Cheng and Wenxu Wu and Shaojin Wu and Mengqi Huang and Fei Ding and Qian He},
  journal= {arXiv preprint arXiv:2509.06818},
  year   = {2025}
}

备注

Project page: https://bytedance.github.io/UMO/ Code and model: https://github.com/bytedance/UMO