Gate-and-Merge:零样本视觉语言模型的组合性个人化
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
本文解决视觉语言模型(VLM)的组合性个人化问题。该问题要求在测试时同时识别或描述多个用户定义概念。我们提出了 Gate-and-Merge,一个零样本框架,使无需共现训练即可实现组合性个人化。在个人化过程中,每个概念独立学习为轻量级 LoRA 适配器,配以概念 token。基础模型保持不变,概念保持解耦。推理时,通过在权重空间直接合并概念特定的 LoRA 更新来实现组合。为抑制无关激活并防止干扰,采用门控机制估计文本和视觉线索,仅选择与预测相关的模块。我们进一步通过仅合并最具意义且相互一致的更新来稳定组合,从而保留每个概念的身份。我们的定量和定性分析显示,在单概念和组合设置中,本方法在多个个人化任务上 consistently 获得性能提升。
引用
@article{arxiv.2605.08702,
title = {Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models},
author = {Guodong Ding and Angela Yao},
journal= {arXiv preprint arXiv:2605.08702},
year = {2026}
}