基于形态学的文本到图像扩散模型中身份流域的识别
计算机视觉与模式识别
2026-02-24 v1
摘要
我们展示了形态学压力在文本到图像生成管道的多个层面上创造了可导航的梯度。在研究1中,稳定扩散1.5中的身份流域可以使用形态学描述符来导航——包括铂金色须发、"beauty mark"(美纹)以及1950年代的"glamour"(华丽)等构成特征,无需目标名称或照片。通过自蒸馈循环(从描述符提示生成合成图像,然后在这些输出上训练LoRA),实现了对特定身份的一致收敛,测量指标为ArcFace相似度。训练好的LoRA创建了一个局部坐标系,不仅塑造目标身份,还塑造其反向:最大远距离条件化会在基础SD1.5中产生"eldritch"(恐怖的)结构崩解,而LoRA装配的模型则产生"uncanny valley"(不安区)输出——连贯但精确错误。在研究2中,我们将其扩展到提示级别的形态学。基于音韵义论,我们从英文音象征性簇(如\emph{cr-}、\emph{sn-}、\emph{-oid}、\emph{-ax})中生成200个新荒诞词,发现含有音象征性的候选词比随机控制组产生更具视觉一致性(平均Purity@1 = 0.371 vs. 0.209,p<0.00001),三个候选——\emph{snudgeoid}、\emph{crashax}和\emph{broomix}——实现完美的视觉一致性(Purity@1 = 1.0),且无训练数据污染,每个都从音象征结构 alone 生成一个独特、连贯的视觉身份。总体而言,这些研究确立了无论是特征描述符还是提示级别的音韵形式的形态学结构,都通过扩散模型潜在空间创建系统性的可导航梯度。我们记录了身份流域中的相位转变、CFG不变的身份稳定性,以及从亚词音模式中涌现的新视觉概念。
引用
@article{arxiv.2602.18533,
title = {Morphological Addressing of Identity Basins in Text-to-Image Diffusion Models},
author = {Andrew Fraser},
journal= {arXiv preprint arXiv:2602.18533},
year = {2026}
}