中文

个性化视觉指令调优

计算机视觉与模式识别 2024-10-10 v1

摘要

最近的多模态大语言模型(MLLM)取得了显著进展,但存在显著局限性,我们称之为"面容失聪"。具体而言,它们可以进行一般性对话,但无法针对特定个体进行个性化对话。这一缺陷阻碍了 MLLM 在需要识别图像中特定个体并进行个性化对话的场景的应用,例如移动设备上的量身定制的视觉助手或需要识别家庭成员的家用机器人。本文引入个性化视觉指令调优(PVIT),一种新的数据 curated 和训练框架,旨在使 MLLM 能够识别图像中的目标个体并进行个性化且连贯的对话。我们的做法涉及开发一个复杂的管道,用于自主生成包含个性化对话的训练数据。该管道利用 various 视觉专家、图像生成模型和(多模态)大语言模型的能力。为评估 MLLM 的个性化潜力,我们提出了一个基准称为 P-Bench,涵盖 various 问题类型且难度不同。实验表明,使用我们 curated 的数据集进行 fine-tuning 后,MLLM 在个性化方面的表现得到了显著提升。

关键词

引用

@article{arxiv.2410.07113,
  title  = {Personalized Visual Instruction Tuning},
  author = {Renjie Pi and Jianshu Zhang and Tianyang Han and Jipeng Zhang and Rui Pan and Tong Zhang},
  journal= {arXiv preprint arXiv:2410.07113},
  year   = {2024}
}