中文

基于大型多模态模型的个性化图像生成

信息检索 2025-02-05 v2 人工智能 多媒体

摘要

个性化内容过滤(如推荐系统)已成为缓解信息过载的关键基础设施。然而,这些系统仅过滤现有内容,受限于其内容的有限多样性,难以满足用户多样化的内容需求。为克服这一限制,个性化内容生成已成为具有广泛应用前景的方向。然而,现有大多数研究仅关注个性化文本生成,针对个性化图像生成的关注相对有限。现有有限的个性化图像生成工作面临着准确捕获用户视觉偏好和需求的挑战,这些挑战源于用户交互图像的噪声和复杂的多模态指令。更糟糕的是,缺乏用于训练个性化图像生成模型的监督数据。为克服这些挑战,我们提出了一个名为 Pigeon 的个性化图像生成框架,采用出色的大型多模态模型,包含三个专门的模块,用于从噪声用户历史记录和多模态指令中捕获用户的视觉偏好和需求。为缓解数据稀缺问题,我们引入了一个两阶段偏好对齐方案,包括掩码偏好重构和两两偏好对齐,用于对齐 Pigeon 与个性化图像生成任务。我们将 Pigeon 应用于个性化贴纸和电影海报生成,其中大量定量结果和人类评估均凸显了其在各种生成基线上的优势。

关键词

引用

@article{arxiv.2410.14170,
  title  = {Personalized Image Generation with Large Multimodal Models},
  author = {Yiyan Xu and Wenjie Wang and Yang Zhang and Biao Tang and Peng Yan and Fuli Feng and Xiangnan He},
  journal= {arXiv preprint arXiv:2410.14170},
  year   = {2025}
}

备注

Accepted for publication in WWW'25