中文

Online-PVLM:基于在线概念学习的个人化视觉语言模型

计算与语言 2025-12-19 v2

摘要

个人化视觉语言模型(PVLM)因其在用户特定概念对齐交互(例如识别用户的自行车)方面的强大能力而日益受到关注。现有方法通常需要为每个新概念学习独立的嵌入向量,无法在测试期间实现实时适应。当面对大规模场景时,概念嵌入的高效检索尤为困难。为缓解这一差距,我们提出 Online-PVLM,一种基于双曲表示进行在线概念学习的框架。我们的方法实现了测试时无需训练即可生成概念嵌入的范式,使个人化视觉语言模型既可扩展又高效。此外,我们开发了 OP-Eval,一个包含 1,292 个概念且超过 3 万个高质量实例的全面大规模基准数据集,旨在严格评估现实场景下的在线概念学习。大量实验表明,我们所提出框架在实际应用中表现优异。我们的源代码和数据集将对外公开。

关键词

引用

@article{arxiv.2511.20056,
  title  = {Online-PVLM: Advancing Personalized VLMs with Online Concept Learning},
  author = {Huiyu Bai and Runze Wang and Zhuoyun Du and Yiyang Zhao and Fengji Zhang and Haoyu Chen and Xiaoyong Zhu and Bo Zheng and Xuejiao Zhao},
  journal= {arXiv preprint arXiv:2511.20056},
  year   = {2025}
}

备注

Work in Progress