中文

DVI:离散语义与视觉身份,用于训练自由的人像生成

计算机视觉与模式识别 2025-12-23 v1

摘要

最近的无调参身份定制方法在面部保真度上取得高水平,但常常忽视视觉背景,如光照、皮肤纹理和环境色调。这种限制导致“语义-视觉不协调”,即准确的面部几何与输入独特氛围冲突,引发不自然的“贴纸式”效果。我们提出 **DVI(Disentangled Visual-Identity)**,一个零样本框架正交地将身份离散为细粒度语义和粗粒度视觉流。不同于仅依赖语义向量的方法,DVI 利用 VAE 潜空间的内在统计特性,将均值和方差作为轻量级描述符用于全局视觉氛围。我们引入**参数自由特征调制**机制,适应性地调制语义嵌入以注入参考的“视觉灵魂”,无需训练。此外,**动态时间粒度调度器**与扩散过程相匹配,优先在早期去噪阶段强调视觉氛围,后期精炼语义细节。广泛的实验表明,DVI 在无参数微调的情况下显著提升了视觉一致性和氛围保真度,保持稳健的身份保持能力,并在 IBench 评估中超越了最先进的方法。

关键词

引用

@article{arxiv.2512.18964,
  title  = {DVI: Disentangling Semantic and Visual Identity for Training-Free Personalized Generation},
  author = {Guandong Li and Yijun Ding},
  journal= {arXiv preprint arXiv:2512.18964},
  year   = {2025}
}