中文

LARE:基于视觉语言模型的区域嵌入潜在增强技术

计算机视觉与模式识别 2024-09-20 v1

摘要

近年来,针对处理图像和文本数据的视觉语言模型得到了大量研究,这些模型被应用于诸如"图像相关聊天"、"按指令进行图像识别"和"回答视觉问题"等多样下游任务。视觉语言模型 (VLM) 如对比语言-图像预训练 (CLIP),也是高性能图像分类器,正在发展为能够利用语言信息将性能扩展到未见领域的领域适应方法。然而,由于这些 VLM 将图像嵌入为统一嵌入空间中的单个点,分类精度仍有提升空间。因此,本研究提出了利用区域嵌入进行潜在增强 (LARE) 方法,将图像作为统一嵌入空间中由 VLM 学习的区域进行嵌入。通过从该潜在区域内采样增强图像嵌入,LARE 实现了对各种未见领域的数据增强,不仅限于特定未见领域。LARE 通过使用增强后的图像嵌入进行微调,实现了在内外域中的鲁棒图像分类。我们在三个基准数据集上证明了 LARE 在图像分类精度方面优于先前的微调模型。我们还展示了 LARE 在多种情况下(如未见领域、数据量小以及数据不平衡)均表现出更鲁棒和更通用的特性。

关键词

引用

@article{arxiv.2409.12597,
  title  = {LARE: Latent Augmentation using Regional Embedding with Vision-Language Model},
  author = {Kosuke Sakurai and Tatsuya Ishii and Ryotaro Shimizu and Linxin Song and Masayuki Goto},
  journal= {arXiv preprint arXiv:2409.12597},
  year   = {2024}
}

备注

10 pages, 4 figures