中文

ReMix:迈向一致性角色生成与编辑的统一视图

计算机视觉与模式识别 2025-10-14 v1

摘要

大规模文本到图像扩散模型(例如 FLUX.1)的最新进展显著提升了角色一致性生成与编辑中的视觉保真度。然而,现有方法很少在单一框架内统一这些任务。基于生成的方法难以在不同实例间保持细粒度的身份一致性,而基于编辑的方法则常常丧失空间可控性与指令对齐能力。为弥合这一差距,我们提出 ReMix,一个用于角色一致性生成与编辑的统一框架。它包含两个核心组件:ReMix 模块与 IP-ControlNet。ReMix 模块利用 MLLM 的多模态推理能力来编辑输入图像的语义特征,并将指令嵌入适配到原生 DiT 主干网络,无需微调。尽管这保证了语义布局的一致性,但像素级一致性与姿态可控性仍然具有挑战性。为此,IP-ControlNet 对 ControlNet 进行了扩展,以解耦参考图像中的语义与布局线索,并引入一个 ε-等价(ε-equivariant)潜空间,在共享噪声空间内对参考图像与目标图像进行联合去噪。受趋同进化与量子退相干(即环境噪声驱动状态收敛)的启发,该设计促进了隐空间中的特征对齐,从而在保持身份的同时实现一致的对象生成。ReMix 支持广泛的任务,包括个性化生成、图像编辑、风格迁移以及多条件合成。大量实验验证了其作为角色一致性图像生成与编辑统一框架的有效性与高效性。

关键词

引用

@article{arxiv.2510.10156,
  title  = {ReMix: Towards a Unified View of Consistent Character Generation and Editing},
  author = {Benjia Zhou and Bin Fu and Pei Cheng and Yanru Wang and Jiayuan Fan and Tao Chen},
  journal= {arXiv preprint arXiv:2510.10156},
  year   = {2025}
}