中文

DECOR:文本嵌入的分解与投影用于文本到图像定制

计算机视觉与模式识别 2024-12-13 v1

摘要

文本到图像 (T2I) 模型能够有效捕获参考图像的内容或风格,以执行高质量定制。代表性技术是使用低秩适应 (LoRA) 进行微调,这使定制能够利用参考图像实现高效。然而,使用有限的参考图像进行微调常导致过拟合,引发提示错位或内容泄漏等问题。这些问题会阻碍模型准确遵循输入提示或在推理时生成不必要的物体。为解决此问题,我们检查引导扩散模型推理期间的文本嵌入。本研究对文本嵌入矩阵进行分解并进行成分分析,以理解嵌入空间几何并识别过拟合原因。基于此,我们提出 DECOR,通过将文本嵌入投影到与不希望的标记向量正交的向量空间,从而减少文本嵌入中不必要语义的影响。实验结果表明,DECOR 在文本和视觉对齐评估指标上均优于当前最先进的定制模型,并在Pareto前沿性能上取得优异成绩。此外,它生成更忠实于输入提示的图像,展示了其在解决过拟合和增强文本到图像定制方面的有效性。

关键词

引用

@article{arxiv.2412.09169,
  title  = {DECOR:Decomposition and Projection of Text Embeddings for Text-to-Image Customization},
  author = {Geonhui Jang and Jin-Hwa Kim and Yong-Hyun Park and Junho Kim and Gayoung Lee and Yonghyun Jeong},
  journal= {arXiv preprint arXiv:2412.09169},
  year   = {2024}
}