中文

面向个性化的大型视觉语言模型

计算机视觉与模式识别 2024-12-24 v1

摘要

个性化模型在图像生成领域已获得显著关注,但在大型视觉语言模型 (LVLMs) 上仍鲜有探索。除通用模型外,具备个性化功能的LVLMs能够通过指代性概念进行交互式对话 (例如,``Mike and Susan are talking'',而非 ``a boy and a girl are talking''),使对话更具可定制性和指代友好性。此外,PLVM 能够在对话期间持续添加新概念,而不会产生额外成本,这显著提升了其实用性。PLVM 提出了Aligner,即一种预训练视觉编码器,用于将指代性概念与查询图像对齐。在对话期间,它提取与这些对应概念相关联的参考图像的特征,并在查询图像中识别它们,从而实现个性化。我们注意到,Aligner 的计算成本和参数数量在整个框架中几乎可以忽略不计。通过全面的定性和定量分析,我们揭示了PLVM的有效性与优越性。

关键词

引用

@article{arxiv.2412.17610,
  title  = {Personalized Large Vision-Language Models},
  author = {Chau Pham and Hoang Phan and David Doermann and Yunjie Tian},
  journal= {arXiv preprint arXiv:2412.17610},
  year   = {2024}
}

备注

A simple way to personalize your LLM