中文

ASemConsist:面向训练免费身份一致生成的自适应语义特征控制

计算机视觉与模式识别 2026-01-05 v2

摘要

近期文本到图像扩散模型显著提升了视觉质量和文本对齐效果,但在保持跨多样化场景描述的字符身份一致性方面仍具挑战性。现有方法在维持身份一致性与确保单张图像提示对齐之间常常难以取得平衡。本文提出一种新框架ASemConsist,通过选择性文本嵌入修改实现对字符身份的显式语义控制,而不牺牲提示对齐。基于对FLUX中填充嵌入的分析,我们提出一种语义控制策略,将填充嵌入用作语义容器。此外,我们引入一种自适应特征共享策略,自动评估文本的歧义性,仅对含歧义的身份提示施加约束。最后,我们提出统一的评估协议,即一致性质量评分(CQS),将身份保持与单张图像文本对齐融合为单一综合指标,显式捕捉两者之间的性能不平衡。我们的框架实现了最先进的性能,有效克服了以往的权衡。项目页面:https://minjung-s.github.io/asemconsist

关键词

引用

@article{arxiv.2512.23245,
  title  = {ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation},
  author = {Shin Seong Kim and Minjung Shin and Hyunin Cho and Youngjung Uh},
  journal= {arXiv preprint arXiv:2512.23245},
  year   = {2026}
}