中文

多模态大模型ID一致性优化:通过对齐、 entangled 与解缘实现面部恢复

计算机视觉与模式识别 2026-02-24 v1 图形学

摘要

多模态编辑大模型在 diverse 任务上展示出强大的编辑能力,但面临一个持续存在的长期局限:在真实肖像编辑中面部身份(ID)一致性下降。鉴于人眼对面部特征的高灵敏度,这种不一致性显著阻碍了这些模型在实际部署中的应用。当前的面部 ID 保存方法难以实现身份与编辑元素 IP 的一致恢复,due to Cross-source Distribution Bias 和 Cross-source Feature Contamination。为此,我们提出 EditedID,一种用于稳健身份特定面部恢复的 Alignment-Disentanglement-Entanglement 框架。通过系统性分析扩散轨迹、抽样器行为和注意力属性,我们引入三个关键组件:1)适配混合策略,在扩散过程中对齐跨源潜在表示;2)混合求解器,解缘源特定身份属性和细节;3)注意力门控机制,选择性地 entangle 视觉元素。大量实验表明,EditedID 在保持原始面部 ID 和编辑元素 IP 一致性方面实现了最先进的性能。作为一种训练自由和即插即用解决方案,EditedID 为在开放式环境下实现实际可靠的单/多人面部身份恢复树立了新基准,为将多模态编辑大模型部署到真实人物编辑场景铺平了道路。代码已公开于 https://github.com/NDYBSNDY/EditedID。

关键词

引用

@article{arxiv.2602.18752,
  title  = {Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement},
  author = {Yuran Dong and Hang Dai and Mang Ye},
  journal= {arXiv preprint arXiv:2602.18752},
  year   = {2026}
}

备注

ICLR 26