中文

Yo'LLaVA:您的个人化语言视觉助手

计算机视觉与模式识别 2024-12-05 v2 机器学习

摘要

大型多模态模型(LMM)在诸多任务(如图像描述、视觉问答)上展现出惊人的能力。然而,这些模型的知识偏向于通用范畴(例如识别狗),无法处理个性化主题(例如识别用户宠物狗)。人类推理通常局限于特定对象的上下文。例如,一个人可能会问:"我该为狗的生日买什么礼物?",而不是泛泊地问:"狗的生日该买什么礼物?"。同样,当观看朋友的照片时,关注点在于了解其活动(例如:"我的朋友正在抱着一只猫"),而不仅仅是观察通用人类动作(例如:"一个男人正在抱着一只猫")。本文提出个性化 LMM 的新任务,使其能够对特定主题进行对话。我们提出 Yo'LLaVA,通过少量示例图像将个性化主题嵌入一组潜在 token。我们的定性和定量分析表明,Yo'LLaVA 能更高效地学习概念,仅需更少的 token 即可更有效地编码视觉属性,优于强大的提示基线方法(如 LLaVA)。

关键词

引用

@article{arxiv.2406.09400,
  title  = {Yo'LLaVA: Your Personalized Language and Vision Assistant},
  author = {Thao Nguyen and Haotian Liu and Yuheng Li and Mu Cai and Utkarsh Ojha and Yong Jae Lee},
  journal= {arXiv preprint arXiv:2406.09400},
  year   = {2024}
}

备注

NeurIPS 2024; Project page: https://thaoshibe.github.io/YoLLaVA