通过潜在拼接与掩码条件流匹配驯服扩散模型中的身份一致性与提示多样性
计算机视觉与模式识别
2025-11-12 v1 人工智能
摘要
主体导向图像生成旨在综合特定主体在多样化情境下的新颖表现,同时保持其核心身份特征。实现强身份一致性和高提示多样性 presents 一个 fundamental trade-off。我们提出一种采用潜在拼接策略的 LoRA 微调扩散模型,联合处理参考图像和目标图像,结合掩码条件流匹配(CFM)目标。该方法无需架构修改即可实现身份保留。为便于大规模训练,我们引入了一个两阶段蒸馏数据 curated 框架:第一阶段利用数据恢复和基于视觉语言模型(VLM)的过滤,从多样化来源创建紧凑高质量的 seed 数据集;第二阶段利用这些 curated 的示例进行参数高效微调,从而将生成能力跨越各种主体和情境进行扩展。最后,对于过滤和质量评估,我们提出了 CHARIS 框架,该框架在五个关键轴向上进行属性级别比较:身份一致性、提示遵循性、区域级颜色保真度、视觉质量和转换多样性。
引用
@article{arxiv.2511.08061,
title = {Taming Identity Consistency and Prompt Diversity in Diffusion Models via Latent Concatenation and Masked Conditional Flow Matching},
author = {Aditi Singhania and Arushi Jain and Krutik Malani and Riddhi Dhawan and Souymodip Chakraborty and Vineet Batra and Ankit Phogat},
journal= {arXiv preprint arXiv:2511.08061},
year = {2025}
}