MC-LLaVA:多概念个性化视觉-语言模型
计算机视觉与模式识别
2026-02-19 v4 人工智能
摘要
当前的视觉-语言模型在各种任务(如视觉问答)中展现出卓越的能力。为了提升用户体验,近期的研究探讨了 VLM 的个性化,以理解用户提供的概念。然而,这些研究主要关注单一概念,忽略了多概念的存在及其相互作用,从而限制了其在真实世界中的适用性。本文提出了 MC-LLaVA,一种多概念个性化范式。具体而言,MC-LLaVA 采用多概念指令微调策略,在单个训练步骤中有效整合多个概念。为降低训练成本,我们提出了一种利用视觉 token 信息初始化概念 token 的个性化文本提示。此外,我们在推理过程中引入了个性化视觉提示,聚合位置图以增强识别与定位能力。为进一步提升性能上限,我们引入了可选的辅助损失,更好地增强所提出的个性化提示。为丰富 VLM 个性化研究,我们贡献了一个高质量数据集。我们精心从电影中收集了包含多人物和多物体的图像,并手动为多概念场景创建了问答样本,具有出色的多样性。综合实验表明,MC-LLaVA 实现了令人印象深刻的多概念个性化响应,为 VLM 成为更好的用户助手铺平了道路。代码和数据集将发布于 \href{https://github.com/arctanxarc/MC-LLaVA}{https://github.com/arctanxarc/MC-LLaVA}。
引用
@article{arxiv.2411.11706,
title = {MC-LLaVA: Multi-Concept Personalized Vision-Language Model},
author = {Ruichuan An and Sihan Yang and Renrui Zhang and Ming Lu and Tianyi Jiang and Kai Zeng and Yulin Luo and Jiajun Cao and Hao Liang and Ying Chen and Qi She and Shanghang Zhang and Wentao Zhang},
journal= {arXiv preprint arXiv:2411.11706},
year = {2026}
}