Online-PVLM:基于在线概念学习的个人化视觉语言模型
计算与语言
2025-12-19 v2
摘要
个人化视觉语言模型(PVLM)因其在用户特定概念对齐交互(例如识别用户的自行车)方面的强大能力而日益受到关注。现有方法通常需要为每个新概念学习独立的嵌入向量,无法在测试期间实现实时适应。当面对大规模场景时,概念嵌入的高效检索尤为困难。为缓解这一差距,我们提出 Online-PVLM,一种基于双曲表示进行在线概念学习的框架。我们的方法实现了测试时无需训练即可生成概念嵌入的范式,使个人化视觉语言模型既可扩展又高效。此外,我们开发了 OP-Eval,一个包含 1,292 个概念且超过 3 万个高质量实例的全面大规模基准数据集,旨在严格评估现实场景下的在线概念学习。大量实验表明,我们所提出框架在实际应用中表现优异。我们的源代码和数据集将对外公开。
引用
@article{arxiv.2511.20056,
title = {Online-PVLM: Advancing Personalized VLMs with Online Concept Learning},
author = {Huiyu Bai and Runze Wang and Zhuoyun Du and Yiyang Zhao and Fengji Zhang and Haoyu Chen and Xiaoyong Zhu and Bo Zheng and Xuejiao Zhao},
journal= {arXiv preprint arXiv:2511.20056},
year = {2025}
}
备注
Work in Progress