基于可学习用户嵌入的用户偏好调制的文本到图像生成——Premier
计算机视觉与模式识别
2026-04-14 v2
摘要
文本到图像生成取得了快速进展,但仍难以捕捉用户偏好的细微差异。现有方法通常依赖多模态大型语言模型推断用户偏好,但派生的提示或潜在代码很少真实地反映用户偏好,导致个性化次优。我们提出了 Premier,一种用于个性化图像生成的新型偏好调制框架。Premier 将每个用户的偏好表示为可学习的嵌入,并引入偏好适配器将用户嵌入与文本提示融合。为实现准确和细粒度的偏好控制,该融合偏好嵌入进一步用于调制生成过程。为增强个体偏好distinctness并提高输出与用户特定风格之间的对齐,我们包含了一种分散损失,用于强制用户嵌入之间的分离。当用户数据稀缺时,新用户表示为在训练期间学习到的现有偏好嵌入的线性组合,从而实现有效的泛化。实验表明,Premier 在相同历史长度下优于先前方法,实现更强的偏好对齐,在文本一致性、ViPer proxy 指标和专家评估方面表现更优。
引用
@article{arxiv.2603.20725,
title = {Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation},
author = {Zihao Wang and Yuxiang Wei and Xinpeng Zhou and Tianyu Zhang and Tao Liang and Yalong Bai and Hongzhi Zhang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2603.20725},
year = {2026}
}