中文

用于个性化文生图生成的方向性文本反转

机器学习 2026-03-11 v2 计算机视觉与模式识别

摘要

文本反转(TI)是一种高效的文生图个性化方法,但通常在复杂提示上失败。我们将这些失败归因于嵌入范数膨胀:学习到的标记漂移到分布外幅度,损害了预归一化 Transformer 中的提示条件化。经验上,我们表明语义主要由 CLIP 标记空间中的方向编码,而膨胀的范数会损害上下文化;理论上,我们分析了大幅度如何削弱位置信息并阻碍预归一化块中的残差更新。我们提出了方向性文本反转(DTI),它将嵌入幅度固定在分布内尺度,并通过黎曼随机梯度下降(Riemannian SGD)仅优化单位超球面上的方向。我们将方向学习表述为具有冯·米塞斯-费舍尔先验的最大后验估计(MAP),导出一个恒定方向的先验梯度,简单且易于集成。在各种个性化任务中,DTI 在保持主体相似度的同时,相比 TI 和 TI 变体提升了文本保真度。关键的是,DTI 的超球面参数化使得学习概念之间能够平滑、语义连贯的插值(slerp),这是标准 TI 所不具备的能力。我们的结果表明,仅优化方向是实现提示忠实个性化的鲁棒且可扩展的路径。代码可在 https://github.com/kunheek/dti 获取。

关键词

引用

@article{arxiv.2512.13672,
  title  = {Directional Textual Inversion for Personalized Text-to-Image Generation},
  author = {Kunhee Kim and NaHyeon Park and Kibeom Hong and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2512.13672},
  year   = {2026}
}

备注

ICLR 2026; Project page: https://kunheek.github.io/dti