面向个性化文本到图像生成的 LLM 驱动风格与内容正则化
计算机视觉与模式识别
2025-04-23 v1
摘要
个性化文本到图像生成技术近期受到了 Stable Diffusion 的兴起推动。现有方法通常通过微调模型并嵌入标识符来实现,往往难以解决风格化不足和图像内容不准确的问题,这源于文本可控性的降低。在本文中,我们提出了风格细化和内容保持策略。风格细化策略利用视觉推理提示和参考图像的语义信息,以优化风格嵌入,实现对风格信息的更精确和一致的表示。内容保持策略通过保留模型的泛化能力来解决内容偏差问题,确保在不损害风格化的前提下增强文本可控性。实验结果验证了我们方法在生成一致且个性化的文本到图像输出方面的优异性能。
引用
@article{arxiv.2504.15309,
title = {LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation},
author = {Anran Yu and Wei Feng and Yaochen Zhang and Xiang Li and Lei Meng and Lei Wu and Xiangxu Meng},
journal= {arXiv preprint arXiv:2504.15309},
year = {2025}
}