中文

多模态大语言模型的超双曲学习

机器学习 2024-08-12 v1 人工智能

摘要

超双曲嵌入已在多种深度学习任务(包括图像分割和主动学习)中展示了其在捕捉不确定性和层次关系方面的有效性。然而,它们在现代视觉-语言模型(VLMs)中的应用一直有限。一个显著的例外是 MERU,它利用超双曲空间的层次特性构建 CLIP ViT-large 模型,该模型包含数亿参数。在我们的工作中,我们通过 BLIP-2 架构解决了将多模态超双曲模型在参数量(数十亿)和训练复杂度上扩展数个数量级的挑战。尽管超双曲嵌入提供了欧几里得嵌入中不存在的关于不确定性的潜在见解,但我们的分析表明,扩展这些模型尤其困难。我们提出了一种新颖的训练策略,用于构建超双曲版本的 BLIP-2,使其能够达到与其欧几里得对应模型相当的性能,同时在训练过程中保持稳定,并显示出每个嵌入具有有意义的不确定性指示。

关键词

引用

@article{arxiv.2408.05097,
  title  = {Hyperbolic Learning with Multimodal Large Language Models},
  author = {Paolo Mandica and Luca Franco and Konstantinos Kallidromitis and Suzanne Petryk and Fabio Galasso},
  journal= {arXiv preprint arXiv:2408.05097},
  year   = {2024}
}

备注

ECCV 2024 - Beyond Euclidean Workshop