MMPB:迈向多模态个性化时代
计算机视觉与模式识别
2025-10-01 v2 人工智能
摘要
视觉个性化在智能家居和医疗等面向用户的 AI 系统中至关重要,它要求模型行为与以用户为中心的概念对齐。然而,尽管近期的大型视觉-语言模型(VLM)具有广泛的适用性,但其适应个体用户的能力仍未被充分探索。本文提出了 MMPB,这是首个用于评估 VLM 个性化能力的全面基准。MMPB 包含 1 万对图像-查询对,涵盖人类、动物、物体和角色四个类别的 111 个可个性化概念,其中人类类别还丰富了基于偏好的查询。我们将个性化任务构建为三种主要类型,每种类型突出 VLM 的不同关键属性。我们使用 23 个广泛使用的 VLM(包括开源和闭源模型),通过三阶段协议评估个性化性能:概念注入、多轮对话和个性化查询。我们的发现表明,大多数 VLM(包括一些闭源模型)在个性化方面表现挣扎,尤其是在保持对话一致性、处理用户偏好以及适应视觉线索方面。我们的分析揭示,VLM 个性化面临的挑战(如拒绝行为和长上下文遗忘)凸显了巨大的改进空间。通过识别这些局限性并提供可扩展的基准,MMPB 为未来研究真正个性化的多模态 AI 提供了宝贵的洞见和坚实的基础。项目页面:aidaslab.github.io/MMPB
引用
@article{arxiv.2509.22820,
title = {MMPB: It's Time for Multi-Modal Personalization},
author = {Jaeik Kim and Woojin Kim and Woohyeon Park and Jaeyoung Do},
journal= {arXiv preprint arXiv:2509.22820},
year = {2025}
}
备注
Accepted in NeurIPS 2025