Ego:面向视觉语言模型的嵌入导向个性化
计算机视觉与模式识别
2026-03-12 v2 人工智能
摘要
支持人类日常生活的 AI 助手正变得越来越可行,推动力来自多模态语言模型的快速进步。一个关键挑战在于克服这些模型的通用性,以提供个性化体验。现有的大规模视觉语言模型个性化方法通常依赖于额外的训练阶段,这限制了通用性和可扩展性,或依赖于带外部预训练模块的工程化管道,这阻碍了部署效率。本文提出一种高效的方法,利用模型固有的能力来捕获个性化概念。具体而言,我们通过利用模型内部注意力机制提取主要代表目标概念的视觉标记。这些标记作为该特定概念的记忆,使模型能够在测试图像中调用并描述该概念。我们对该方法和 SOTA 方法进行了全面且统一的评估,涵盖各种个性化设置,包括单概念、多概念和视频个性化,显示在最小化个性化开销方面表现显著提升。
引用
@article{arxiv.2603.09771,
title = {Ego: Embedding-Guided Personalization of Vision-Language Models},
author = {Soroush Seifi and Simon Gardier and Vaggelis Dorovatas and Daniel Olmeda Reino and Rahaf Aljundi},
journal= {arXiv preprint arXiv:2603.09771},
year = {2026}
}
备注
Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026