YoChameleon:个性化视觉语言生成
计算机视觉与模式识别
2025-04-30 v1 人工智能
摘要
大型多模态模型(如 GPT-4、Gemini、Chameleon)已发展为具有数百万用户的强大工具,但它们仍是通用模型,缺乏对特定用户概念的个人化知识。以前的工作探索了文本生成的个人化,但尚不清楚这些方法如何适用于新模态,如图像生成。本文介绍了 YoChameleon,是首次尝试研究大型多模态模型个人化的工作。给定特定概念的 3-5 张图像,YoChameleon 利用软提示调谐将主题特定信息嵌入模型,以(i)回答关于该主题的问题,和(ii)再现像素级细节以生成该主题在新情境中的图像。YoChameleon 采用(i)自提示优化机制平衡多模态性能,和(ii)“软正”图像生成方法在少样本设置下提升图像质量。
引用
@article{arxiv.2504.20998,
title = {YoChameleon: Personalized Vision and Language Generation},
author = {Thao Nguyen and Krishna Kumar Singh and Jing Shi and Trung Bui and Yong Jae Lee and Yuheng Li},
journal= {arXiv preprint arXiv:2504.20998},
year = {2025}
}
备注
CVPR 2025; Project page: https://thaoshibe.github.io/YoChameleon