中文

TextBoost:面向个性化文本到图像生成的文本编码器增强

计算机视觉与模式识别 2026-05-20 v2

摘要

在本文中,我们介绍了 TextBoost,一种用于文本到图像扩散模型的高效单样本个性化方法。传统的个性化方法通常需要微调模型的大部分参数,导致巨大的存储需求和缓慢的收敛速度。相反,我们提出仅选择性微调文本编码器,显著提高了计算和存储效率。为了保持原始语义完整性,我们开发了一种新颖的保因果自适应机制。此外,采用轻量级适配器在文本嵌入与交叉注意力层交互之前对其进行局部细化,以极小的计算开销大幅增强了文本嵌入的表现力。在多种概念上的实证评估表明,TextBoost 实现了更快的收敛速度,并通过最小化可训练参数数量大幅降低了存储需求。此外,与现有方法相比,TextBoost 保持了相当的主体保真度、更优的文本保真度以及更高的生成多样性。我们表明,我们提出的方法为高质量文本到图像个性化提供了一种高效、可扩展且实用的解决方案,在资源受限的环境中尤为有益。

关键词

引用

@article{arxiv.2409.08248,
  title  = {TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation},
  author = {NaHyeon Park and Kunhee Kim and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2409.08248},
  year   = {2026}
}

备注

Project page: https://textboost.github.io. Accepted to TMLR