个性化工具包:大型视觉语言模型的免训练个性化
计算机视觉与模式识别
2026-04-29 v4
摘要
大型视觉语言模型(LVLMs)的个性化涉及定制模型以识别特定用户或对象实例,并生成上下文相关的响应。现有方法依赖于对每个项目进行耗时的训练,这使得它们在实际部署中不切实际,这一点在当前仅限于以对象为中心的单概念评估的个性化基准中有所体现。在本文中,我们提出了一种新颖的免训练 LVLM 个性化方法,称为 Personalization Toolkit。我们引入了一个全面的、面向真实世界的基准,旨在严格评估个性化任务的各个方面。Personalization Toolkit 利用预训练的视觉基础模型提取判别性特征,应用检索增强生成(RAG)技术来识别视觉输入中的实例,并采用视觉提示策略来引导模型输出。我们的模型无关视觉工具包能够在图像和视频上实现高效且灵活的多概念个性化,无需任何额外训练。我们取得了最先进的结果,超越了现有的基于训练的方法。
引用
@article{arxiv.2502.02452,
title = {Personalization Toolkit: Training Free Personalization of Large Vision Language Models},
author = {Soroush Seifi and Vaggelis Dorovatas and Matteo Cassinelli and Fabien Despinoy and Daniel Olmeda Reino and Rahaf Aljundi},
journal= {arXiv preprint arXiv:2502.02452},
year = {2026}
}
备注
Accepted at Transactions on Machine Learning Research (TMLR) 2026